«Сбер» опубликовал исходные веса FRIDA-Decisions — модели для принятия структурированных решений по тексту. Она получает текст и заданные варианты ответа, после чего может выбрать нужную категорию, оценить текст по шкале, определить ответ «да» или «нет» либо ранжировать несколько вариантов. Проект разработан командой УЭСМО, SberAI и опубликован под лицензией MIT.

В основе FRIDA-Decisions используется модель FRIDA на базе энкодера T5. Новая версия содержит 823 млн параметров и поддерживает четыре типа задач: выбор одного варианта, порядковую оценку, проверку утверждения по принципу «да/нет» и ранжирование нескольких кандидатов. Результатом работы становится выбранный вариант, оценка или порядок заданных вариантов, а не сгенерированный текст.

Механизм работы FRIDA-Decisions отличается от генеративных языковых моделей. В обычной LLM ответ формируется последовательно, токен за токеном. FRIDA-Decisions кодирует исходный текст и сопоставляет его с заданными вариантами. Это позволяет использовать один и тот же текст для нескольких задач, а при повторной обработке — сохранять промежуточное состояние с помощью кэша.

Разработчики отдельно приводят тест с каталогом из 243 категорий. По их данным, на видеокарте RTX 5060 Ti обработка такого запроса занимала около 0,44 секунды при использовании упаковки вариантов и кэша состояния. При последовательной обработке каждого варианта отдельным запросом результат составлял около 4,65 секунды.

Модель также адаптирована для работы на центральных процессорах. Для этого разработчики опубликовали версию в формате ONNX с 8-битным квантованием. В одном из тестов запрос с текстом примерно на 384 токена и тремя вопросами обрабатывался за 0,88 секунды на шести потоках CPU. Версия на PyTorch в формате FP32 при тех же условиях показывала результат около 2,28 секунды.

FRIDA-Decisions также протестировали на наборе razvilka, включающем 735 русскоязычных примеров и 15 типов задач. В него входили классификация, маршрутизация, модерация, анализ тональности и ранжирование. По результатам тестирования разработчиков, FRIDA-Decisions получила значение метрики 0,893. Для коммерческой системы TypeSafe Jev в том же сравнении указано 0,897, а версия FRIDA-Decisions в формате ONNX на CPU показала 0,891.

Для обучения модели использовали 1,42 млн примеров и около 1,5 млн вопросов, охватывающих 151 тип задач. Согласно данным разработчиков, 71% обучающих данных были русскоязычными, ещё 29% — англоязычными. Около четверти набора, по оценке команды, содержала тексты или метки, созданные с использованием языковых моделей.

Читайте ещё материалы по теме:

Сейчас на главной

Российское моторное масло G-Energy испытали на китайских автомобилях в московском таксопарке

Российское моторное масло G-Energy испытали на китайских автомобилях в московском таксопарке

Машины с трёхцилиндровыми турбомоторами прошли на масле от «Газпромнефти — СМ» 10 тыс. км при ежедневной интенсивной эксплуатации

Фейковый поиск по картинке крадёт доступ к банку: МВД предупредило о новой схеме

Фейковый поиск по картинке крадёт доступ к банку: МВД предупредило о новой схеме

После установки вредонос просит перезагрузить смартфон, а затем показывает поддельное сообщение о вирусной активности