Step-3.7-Flash: новая мультимодальная модель для agent и coding сценариев
29 мая 2026 года StepFun, также известная как 阶跃星辰, представила step-3.7-flash как флагманскую мультимодальную reasoning-модель для рабочих процессов с агентами, кодом и длинным контекстом. По позиционированию это не просто чат-модель, а более прикладной инструмент для частых agent-вызовов, исправления кода, анализа документов, понимания изображений и видео, а также задач вроде "скриншот в код" или "счет-фактура в таблицу".
Важно читать цифры трезво: основные характеристики ниже взяты из официальной публикации и model card. До широких независимых воспроизведений их лучше цитировать как заявленные производителем, особенно если речь идет о скорости генерации, latency под нагрузкой или качестве в конкретной бизнес-задаче.
Что именно вышло
step-3.7-flash описывается как MoE-модель примерно на 198B общих параметров и около 11B активных параметров на токен. В model card детализация чуть точнее: 196B приходится на языковой backbone и 1.8B на визуальный encoder. Такая конфигурация объясняет позиционирование "flash": модель пытается сочетать крупный общий capacity с относительно экономичным активным вычислением.
Контекстное окно заявлено на уровне 256K tokens. Для практики это означает, что в один запрос можно помещать большие репозитории, длинные спецификации, договоры, логи, подборки документов или историю agent-сессии без слишком раннего сжатия контекста.
Ключевые характеристики
| Параметр | Значение |
|---|---|
| Модель | step-3.7-flash |
| Тип | флагманская мультимодальная reasoning-модель |
| Архитектура | MoE |
| Параметры | около 198B всего, около 11B активных |
| Детализация model card | 196B language backbone + 1.8B visual encoder |
| Контекст | 256K tokens |
| Reasoning effort | low, medium, high |
| Заявленная скорость | до 400 tokens/s по данным производителя |
| Лицензия весов/model card | Apache-2.0 |
Поддержка low, medium и high reasoning effort особенно полезна для agent-систем. Для простых шагов можно снижать рассуждение и экономить latency, а для сложного планирования, анализа кода или многошаговой проверки включать более высокий режим.
API и регионы
StepFun заявляет совместимость с двумя популярными форматами API:
- OpenAI Chat Completions
- Anthropic Messages
Для китайского региона базовый endpoint указан как https://api.stepfun.com/v1, для международного доступа - https://api.stepfun.ai/v1. Это снижает стоимость интеграции для команд, у которых уже есть клиентский слой под OpenAI-compatible chat completions или Claude-style messages.
Цены на момент публикации
Официальные цены разделены по регионам.
| Регион | Input cache miss | Input cache hit | Output |
|---|---|---|---|
| Китай | 1.35 юаня / 1M tokens | 0.27 юаня / 1M tokens | 8.1 юаня / 1M tokens |
| Международный | $0.20 / 1M tokens | $0.04 / 1M tokens | $1.15 / 1M tokens |
Для агентных приложений cache hit цена важна не меньше, чем базовый input. Если система часто повторно передает инструкцию, schema, policy, tool descriptions или длинный неизменный контекст, грамотное кеширование может заметно менять экономику.
Где модель выглядит особенно уместной
Для high-frequency agent сценариев step-3.7-flash интересна сочетанием большого контекста, мультимодальности и управляемого reasoning effort. Например, агент может читать длинную задачу, смотреть скриншот, проверять код, формировать patch-план и затем выполнять уточняющие шаги без постоянного переключения между разными моделями.
В coding задачах модель стоит рассматривать для генерации кода, локализации багов, объяснения diff, миграции API, написания тестов и восстановления логики по большому контексту репозитория. 256K tokens особенно полезны, когда ошибка размазана между несколькими файлами или когда нужно сопоставить реализацию с документацией.
В мультимодальных workflow практичные сценарии включают понимание изображений и видео, превращение скриншотов интерфейса в код, извлечение таблиц из квитанций и счетов, разбор форм, проверку визуального состояния страницы и подготовку структурированных данных из смешанных источников.
Открытые веса и локальное развертывание
Еще одна заметная часть релиза - открытые веса и model card под Apache-2.0. Для команд, которым важны контроль инфраструктуры, приватность или оптимизация latency, это открывает путь к самостоятельному развертыванию.
В списке поддерживаемых runtime и inference-стеков указаны vLLM, SGLang, Transformers, llama.cpp и NVIDIA NIM. На практике выбор зависит от железа, требований к throughput, batch serving, quantization и того, нужен ли мультимодальный pipeline в production-режиме.
На что обратить внимание перед внедрением
Скорость "до 400 tokens/s" лучше воспринимать как официальный верхний ориентир, а не универсальную гарантию. Реальная производительность будет зависеть от региона API, размера контекста, reasoning effort, мультимодального input, concurrency и выбранного serving stack при self-hosting.
То же касается качества в coding и agent задачах. Перед масштабированием стоит собрать собственный benchmark: типовые pull request, реальные баги, длинные документы, изображения из ваших процессов и несколько сценариев с tool calling. Для агентных систем полезно отдельно измерять не только final answer quality, но и количество шагов, стоимость, retry rate и стабильность форматированного вывода.
Как подключать без лишней перестройки
Если в вашем продукте уже есть слой вызова LLM через OpenAI-compatible Chat Completions или Claude/Anthropic Messages, step-3.7-flash можно тестировать как еще один route с отдельным model ID, endpoint и тарифной логикой. В более зрелой архитектуре удобно подключать его через единый LLM API gateway: так проще сравнивать модели, держать общий учет затрат, переключать регионы и постепенно выводить модель в agent, coding или мультимодальные сценарии без обещаний "одна модель решит все".