искусственный интеллект · дообучение моделей · Thomson Reuters · корпоративный AI · RAG · обучение с подкреплением30 сентября в 04:32 · 4 мин

Имаго в масштабе корпорации: как Thomson Reuters создала свою модель за 40 миллионов долларов

Крупнейший медиахолдинг Thomson Reuters решил не арендовать мощные облачные модели от вендоров, а создать собственный ИИ-стек. Спустя три месяца и инвестиции в 40 миллионов долларов компания разработала уникальную методологию «фабрики моделей», которая позволяет интегрировать глубокую экспертизу в веса нейросети. Этот кейс подтверждает, что для организаций с уникальными данными и сложными процессами путь от облачного API к владению собственной архитектурой неизбежен.

# Имаго в масштабе корпорации: как Thomson Reuters создала свою модель за 40 миллионов долларов

В мире искусственного интеллекта тренд смещается от использования универсальных облачных сервисов к созданию специализированных решений внутри организации. Это особенно актуально для сфер, где цена ошибки высока, а нюансы контекста критичны. Именно в таких условиях оказался международный медиахолдинг Thomson Reuters.

Компания, чья капитализация превышает 80 миллиардов долларов и которая объединяет в себе агентство новостей Reuters, юридические базы данных и сервисы для бухгалтеров, столкнулась с необходимостью автоматизации работы с огромным объемом внутренней информации. Вместо закупки доступа к передовым фронтьер-моделям (так называемым моделям frontier), Thomson Reuters инициировал внутреннюю программу разработки.

Собственная «фабрика» вместо аренды чужих мощностей

Для реализации проекта был задействован коллектив из тридцати ученых, работающих в течение трех месяцев. Итогом стал собственный стек технологий, включающий две модели: Thomson-1.0-Large и Thomson-1.0-Small. В основе их создания легли открытые чекпоинты архитектуры Qwen (версии 3.5 и 3.6). Несмотря на значительные вычисления на 368 GPU NVIDIA B200, стоимость непосредственного обучения финальной версии модели составила менее 450 тысяч долларов. Однако общая стоимость инициативы, включая инфраструктуру и исследования, достигла 40 миллионов долларов.

Главная цель проекта заключалась не просто в дообучении модели, а в создании воспроизводимой системы — так называемой «фабрики моделей». Эта система позволяет компании превращать закрытые данные и внутренние правила в управляемый программный продукт. Для Thomson Reuters это означает полный контроль над знаниями, инструментами и процессами, а не просто потребление чужих алгоритмов, которые могут давать «средний по больнице» результат в узкой нише правового или финансового анализа.

*«В моем подходе адаптер работает как строитель, знающий проект. В Thomson модель знает корпус всей организации и её ценности. Это одна и та же философия, но реализованная на другом уровне».*

Трехэтапный подход к обучению

Разработчики Thomson Reuters детально описали методологию, которая позволяет встроить модель в существующую инфраструктуру без потери качества. Процесс был разбит на три ключевых этапа, каждый из которых решает свою задачу.

Этап первый: Конституция и ценности. Здесь модель переобучается под корпоративные правила. Нежелательное поведение устраняется прямым редактированием весов без полного цикла обучения. Для закрепления этих норм используются техники LoRA-адаптации, что позволяет эффективно управлять поведением модели, не нарушая её базовые функции.

Этап второй: Промежуточное обучение (Mid-training). На этом этапе происходит работа с данными. Из огромного корпуса информации компании, превышающего 19 триллионов токенов, было отобрано только 200 миллиардов. Это означает, что более 98% данных были отфильтрованы. Отбор производился не случайно, а по строгому принципу: треть выборки составляли проприетарные документы, вторая часть — их синтетические пересказы (превращение документа в обучающий урок с вопросами и ответами), и третья часть — реплей общих данных для предотвращения катастрофы забывания. Особенностью подхода стало слияние полученного чекпоинта с исходным, что, по данным авторов, дало лучший баланс адаптации и сохранения общих способностей.

Этап третий: Полировка и агентные задачи. Финальная стадия включает обучение модели работе с внутренними инструментами организации. Вместо традиционного обучения с учителем (SFT), которое часто ведет к потере навыков, разработчики использовали прямую оптимизацию предпочтений (DPO) и обучение с подкреплением (RL). Это позволило модели научиться отличать правдоподобные, но неверные ответы от верных, используя пары «выбранный/отклоненный» как механизм обучения.

Результаты и практические выводы

По результатам независимых бенчмарков модель Thomson-1.0-Large показала высокие показатели: 78,5% на общих тестах, что сопоставимо с уровнями Claude Sonnet 5, и 79,5% по данным Claude Opus 4.8. При этом авторы честно признают, что навыки написания кода не были целью этого проекта и в процессе перераспределения весов эти способности пострадали.

Важнейший вывод для сообществ, работающих с ИИ, заключается в иерархии знаний. Для Thomson Reuters стало очевидно, что разные типы информации требуют разных методов хранения: быстрые факты и меняющаяся документация должны оставаться в системе RAG (поиск по Retrieval Augmented Generation), привычки работы команды фиксируются в адаптерах, а фундаментальные знания предметной области закрепляются в весах модели.

Этот кейс демонстрирует, что идея «модели как части организации» масштабируется. Даже для гигантов вроде Thomson Reuters, несмотря на колоссальные ресурсы, приоритет остается за качеством данных и правильной методологией, а не просто за увеличением объема вычислений. Для небольших компаний, не имеющих миллионов долларов на инфраструктуру, стратегия остается схожей: начинать стоит с создания качественного датасета организации, так как именно он переживет любые базовые модели.

Система Thomson также отказалась от изолированного SFT, подтверждая гипотезы о том, что он быстро деградирует другие способности нейросети. Вместо этого был выбран путь комбинации слияния весов и обучения с подкреплением, что в итоге дало более стабильный и полезный результат в конкретной бизнес-среде.

Первоисточники

Habr AI ↗
← Вернуться в эфир