Модель Harvey: как стартап без миллиардов обгоняет OpenAI
Компания Harvey, специализирующаяся на правовых услугах для юристов, доказала, что создание конкурентоспособных AI-моделей возможно без огромных капитализаций. В статье раскрывается методика построения «микро-лаборатории» через синтез данных, использование open-source инструментов и сотрудничество с неолабами.

# Как стартап без миллиардных вложений строит AI-лабораторию уровня frontier
Рынок искусственного интеллекта часто кажется игрой для гигантов: OpenAI, Anthropic и Google DeepMind обладают немыслимым бюджетом на вычисления и доступом к уникальным дата setам. Однако на недавней конференции венчурного фонда Sequoia основатель компании Harvey, специализирующейся на AI для юридических фирм, предложил радикально иную стратегию. Его тезис, отсылающий к фильму «Миллион долларов за тело» («Moneyball»), звучит так: при правильной методологии и ограниченных ресурсах можно создать модель, которая изменит отрасль.
Команда перевела подробный разбор опыта Harvey, показывающий, как application layer-стартапы (те, кто создает продукты поверх фундаментальных моделей) могут конкурировать с крупными исследовательскими центрами.
Архитектура «микро-лаборатории»
Основатель Harvey столкнулся с классической проблемой: для создания собственной модели требуются огромные объемы данных, вычислительных мощностей и времени на разработку инфраструктуры. Традиционный путь — строить свои дата-центры и писать код с нуля — слишком дорог и длителен для стартапа.
Решение Harvey заключалось в опоре на развивающуюся экосистему. На сегодняшний день рынок предлагает сильные open-source модели, инструменты для постобучения (fine-tuning) и готовые облачные сервисы. Это позволяет стартапам не строить «свой движок», а использовать готовые компоненты, аналогично тому, как архитекторы строят здания на фундаменте, заложенном другими.
Методология Harvey разбита на три ключевых этапа: 1. Создание бенчмарков и сбор данных. Формирование наборов задач с четкими критериями оценки. Модель решает эти задачи, а команда анализирует точность. 2. Постобучение. Использование собранных данных для донастройки базовой модели под специфику отрасли. 3. Интеграция. Подключение обученной модели к продукту через внешних инфраструктурных провайдеров.
Проблема конфиденциальности и синтетические данные
Главным препятствием для Harvey стали юридические тайны. Юридические фирмы не могут предоставить доступ к реальным делам, переписке и ходатайствам клиентов для обучения модели из-за строгих требований конфиденциальности и адвокатской тайны. Без доступа к «сырым» данным и процессу работы над ними модель обучалась бы лишь на финальных результатах, что недостаточно для качественного понимания контекста.
Вместо того чтобы ждать, когда клиенты дадут согласие, команда приняла решение сгенерировать синтетические данные. AI создал тысячи вымышленных юридический сделок, включающих до 10 000 связанных документов. В эти документы были искусственно внедрены конкретные ошибки и противоречия, которые должны были найти модель.
Этот подход позволил обойти проблему «курицы и яйца»: фирма не требовала данных для доказательства эффективности, а Harvey показала эффективность на идеально сконструированных вымышленных сценариях. Модель училась искать риски, выявлять несоответствия и формировать отчеты так же, как и на реальных кейсах, но без нарушения этики.
Экономия на этапе валидации
Процесс обучения требует постоянной проверки качества. Для Harvey это означало тысячи автоматических тестов, где ответы модели оценивались либо автоматически, либо другими языковыми моделями (LLM). Стоимость такой проверки колоссальна: использование закрытых премиальных моделей для оценки тысяч прогонов могло стоить десятки тысяч долларов.
Для минимизации затрат Harvey перешла на использование эффективных open-source моделей для валидации, например DeepSeek. Это позволило снизить стоимость оценки одного набора данных до символических сумм, сохранив при этом высокое качество проверки. Более того, публикация части бенчмарков (Legal Agent Bench) в открытом доступе привлекла внимание научного сообщества, сделав их отраслевым стандартом для тестирования правовых AI-систем.
Сила неолабов и инфраструктура
Инфраструктура постобучения сложна. Harvey не пытается делать всё сама. Вместо этого компания работает с неолабами — небольшими специализированными лабораториями, каждая из которых фокусируется на узкой задаче: Fireworks занимается выбором оптимальной модели, Trajectory — непрерывным обучением, Baseten — обработкой длинного контекста.
Такая стратегия позволяет стартапу гибко масштабироваться. Harvey одновременно запускает эксперименты на нескольких платформах, быстро накапливая экспертизу. Важно отметить, что, несмотря на открытость бенчмарков, сами данные клиентов и настроенные под конкретные фирмы модели остаются закрытыми, что защищает коммерческую тайну заказчиков.
Цикл непрерывного улучшения
Постобучение — это не разовое действие, а непрерывный процесс. Harvey выстроила систему, где каждая модель проходит строгий фильтр: от теста на бенчмарках до «слепых» экспертных тестов и проверки в реальных сценариях использования.
Ключевой элемент этой системы — обратная связь от пользователей. «Письма от недовольных клиентов» становятся источником данных для улучшения моделей. Если AI-агент ошибается в реальной работе, но проходит тест на бенчмарке, это сигнал о том, что набор тестовых данных не охватывает все нюансы практики. В такой ситуации команда обновляет обучающую среду и запускает новый цикл дообучения.
Вывод
Опыт Harvey демонстрирует, что конкуренция с гигантами AI возможна не за счет гонки на количество параметров, а за счет глубины специализации. Использование open-source инструментов, синтетических данных и модульной архитектуры с внешними экспертами позволяет стартапам достигать уровня frontier-моделей при fraction of costs, которые требуют гиганты. Сегодня возможность создать собственную высокоуровневую AI-лаборатория доступна не только избранным, но и тем, кто готов выстроить правильную методологию.