В Ollama версии 0.35.0 появилась поддержка decision-моделей через эндпоинт /v1/systemone, основанный на API Jev от TypeSafe. Они возвращают выбор, вероятности и оценки, а не свободный текст. Доступны Nimble от Bespoke Labs и Tev1 от Together AI.
Nimble — это модель на 9B, дообученная из Qwen3.5-9B. Лицензия Apache 2.0. На MacBook Pro с M5 Max отвечает менее чем за 100 мс. В одном запросе можно задать до 64 вопросов к одному тексту. На 13 публичных датасетах с разметкой от людей (3 880 решений) средняя точность Nimble — 75,7%. У Jev 1.13 от TypeSafe на том же наборе 76,0%.
Tev1 выпускается в двух размерах: 4B и 0.8B. Версия 0.8B весит 812 МБ. Обе дообучены из Qwen3.5. Датасеты и скрипты обучения — под лицензией MIT. На том же бенчмарке Tev1 4B даёт 73,3%, Tev1 0.8B даёт 63,5%. На своём внутреннем наборе из 1 000 примеров Together AI заявляет 88,0% точности для 4B.
API принимает state (текст для оценки) и от 1 до 64 вопросов трёх типов. Это choice (выбор из 2–26 вариантов с вероятностями), noul (вероятность истинности условия) и score (оценка по упорядоченной шкале). Контекст у Tev1 около 2 000 токенов, у Nimble 8 192 токена. Decision-модели пока доступны только через API /v1/systemone или Python SDK от TypeSafe. В CLI Ollama и её клиентских библиотеках их ещё нет.
Где это полезно в агентском стеке
Decision-модели подходят там, где нужно быстрое решение по правилу: триаж обращений, роутинг между моделями или инструментами, модерация вызовов инструментов. В документации Ollama есть готовые примеры: роутинг промптов между маленькой и большой моделью, проверка вызова run_shell на вредоносность. По данным Bespoke Labs, Nimble учили на контрастных парах. В паре один факт меняется, и правильный ответ переворачивается.
Что проверить у себя
Bespoke Labs предупреждает: вероятность 0.9 не означает точность 90% на ваших данных. Любой порог стоит проверять на собственных данных. Together AI отдельно отмечает, что не тестировала защиту от промпт-инъекций, работу с языками кроме английского и калибровку. При критичных решениях модель не должна быть единственной проверкой.