Искусственный интеллект · Бенчмаркинг · Andreessen Horowitz · Стартапы · TechCrunch · Регулирование ИИ · Венчурные инвестиции19 сентября в 18:32 · 4 мин

Vals нацелена на создание золотого стандарта бенчмаркинга для искусственного интеллекта

Стартап Vals, получивший серию A в размере 40 миллионов долларов во главе с Andreessen Horowitz, стремится преобразовать индустрию оценки моделей ИИ. Основатель компании заявляет о переходе от абстрактных тестов на знание фактов к проверке способности алгоритмов выполнять сложные профессиональные задачи в реальном секторе, включая право, финансы и кибербезопасность.

# Vals стремится сделать бенчмаркинг нейтральным ресурсом для индустрии ИИ

В современном ландшафте искусственного интеллекта бенчмаркинг (эталонное тестирование) стал обязательным стандартом для вендоров. Однако существующие системы часто устаревают: они не успевают за темпом развития новых моделей и, что более критично, допускают возможность «подготовки к экзамену», когда компании обучают свои алгоритмы на открытых тестовых наборах данных.

Компания Vals, основанная в 2024 году, позиционирует себя как решение этой проблемы. Получив значительное финансирование, стартап нацелен на создание более честной и точной метрики эффективности, которая будет отвечать на вопрос не о том, «что модель знает», а о том, «что модель умеет делать» в реальных сценариях.

От абстракции к практической применимости

Ранее оценки искусственного интеллекта фокусировались на абстрактном интеллекте. Типичные тесты проверяли, способен ли алгоритм сдать экзамен юриста или пройти квалификацию на врача, основываясь на базовых фактах. Как отмечает сооснователь Vals Райан Кришнан, «исторически оценка проводилась очень абстрактно. Мы спрашивали: знают ли модели достаточно информации, чтобы справиться с тестом вроде экзамена на адвокатскую практику?»

Новая стратегия Vals заключается в отказе от публичного раскрытия материалов тестов. Доступ к специфическим задачам предоставляется только платно и в закрытом режиме. Это исключает возможность подтасовки результатов путем предобучения модели на тех же данных, на которых она позже будет проходить проверку.

Вместо проверки общих знаний акцент смещается на способность выполнять конкретные задачи в узких отраслях. «Мы оцениваем модели на их способность завершать сложные задачи, связанные с конкретными индустриями, такими как право, финансы и программирование», — заявил Кришнан. Цель системы — сопоставить качество продукта, созданного ИИ, с качеством работы человека в конкретной профессиональной сфере.

Кроме того, новая методология учитывает не только позитивные результаты, но и потенциальные негативные последствия. Система анализирует риски: «Что произойдет, если эти модели будут работать в мире без ограничений? Какое негативное влияние они могут оказать?»

Расширение сферы применения и новые вызовы

Потребность в таких независимых проверках растет по мере выхода на рынок более совершенных алгоритмов. Vals уже развивает тесты за пределами традиционных бизнес-сфер, включая более сложные и рискованные области.

Среди уникальных направлений оценки стартапа называют: * Рекурсивное самоусовершенствование: способность модели улучшать собственный код без участия человека. * Ментальное здоровье и кибербезопасность: оценка рисков, возникающих при использовании ИИ в этих чувствительных сферах. * Биобезопасность: защита биологических данных и методов. * Законы вооруженного конфликта: проверка на понимание и применение Женевской конвенции моделями искусственного интеллекта.

Этапы такой оценки формируются на основе реальных рабочих процессов и сценариев, а не просто наборов вопросов с вариантами ответов.

Бизнес-модель и будущее индустрии

Модель монетизации Vals может показаться парадоксальной: компании платят за получение данных о слабых сторонах своего алгоритма. Однако, по мнению основателя, это напоминает ситуацию со студентами, сдающими SAT (экзамен на поступление в вузы в США). Оплата услуги College Board позволяет студенту получить объективную картину своих знаний и возможности улучшить их перед поступлением. Для разработчиков ИИ эти данные становятся ключевыми для отладки, улучшения продукта и принятия стратегических решений.

Финансовые показатели стартапа свидетельствуют о растущем спросе. За последний год выручка компании выросла в восемь раз. Команда, начав с восьми сотрудников, уже достигла штата в 25 человек и планирует нанять еще 10–15 специалистов в ближайшее время.

Кришнан видит в системе оценки Vals фундаментальный сдвиг в индустрии. «Компании, разрабатывающие ИИ, начинают выходить на биржу: SpaceX уже публичная, Anthropic планируется в этом году, OpenAI скоро тоже, — предположил основатель. — Когда модели станут неотъемлемой частью экономики, именно наши типы бенчмарков будут определять их использование и станут центральной частью публичных отчетов компаний перед инвесторами».

Таким образом, Vals стремится стать не просто сервисом для тестирования, а стандартом доверия, необходимым для интеграции сложных технологий в глобальную экономику.

*Термины для справки:

Бенчмаркинг — это процесс оценки производительности, качества или других характеристик системы, устройства или услуги путем сравнения их с эталоном (стандартом) или конкурентами.

Серия A — стадия раннего финансирования венчурных инвестиций, следующая за первичной (Seed). На этом этапе компания обычно подтверждает жизнеспособность продукта и масштабирует бизнес-модель.

Подготовка к экзамену в контексте ИИ — ситуация, когда разработчик использует открытый набор данных для тестов, чтобы «натренировать» модель на правильных ответах перед проведением официальной проверки, что искажает результаты оценки реальных возможностей алгоритма.*

Первоисточники

TechCrunch AI
← Вернуться в эфир