Стартап Guide Labs из Сан-Франциско представил новую разработку в сфере искусственного интеллекта. Компания выпустила открытую большую языковую модель Steerling-8B, которая решает давнюю проблему интерпретируемости ИИ. Её архитектура позволяет отследить каждый сгенерированный токен до исходных данных обучения.
Модель Steerling-8B имеет 8 миллиардов параметров. Её создали сооснователи Guide Labs — CEO Джулиус Адебайо и главный научный сотрудник Ая Абдельсалам Исмаил. Эта разработка позволяет понять, почему ИИ принимает те или иные решения, что особенно важно для сложных моделей, таких как Grok или ChatGPT, которые иногда выдают странные или ошибочные результаты.
В основе Steerling-8B лежит новая архитектура. Разработчики встраивают в модель «слой концепций», который группирует данные по отслеживаемым категориям. Это требует больше предварительной разметки данных, но для этого используются другие ИИ-модели. Такой подход помогает, например, определить источники фактов, которые приводит модель, или понять её восприятие юмора и гендера.
Интерпретируемость важна для многих сфер. Для пользовательских LLM это позволит блокировать использование материалов, защищённых авторским правом, или лучше контролировать выдачу по темам вроде насилия. В регулируемых отраслях, например, в финансах, модели, оценивающие заёмщиков, смогут учитывать только финансовые данные, игнорируя расу. Также это полезно в науке, где нужно понимать, почему ИИ находит успешные решения, как в случае со свёртыванием белков.
Guide Labs заявляет, что Steerling-8B достигает 90% возможностей существующих моделей, но при этом требует меньше данных для обучения благодаря своей уникальной архитектуре. Компания, вышедшая из Y Combinator и привлекшая $9 миллионов инвестиций в ноябре 2024 года, планирует создать более крупную модель и предложить API-доступ пользователям.









