2026 г.

Современные LLM: обзор моделей (сентябрь 2026)

Проект ЦИТадель

Состояние на 10 сентября 2026 года. Эта статья отделена от учебника по большим языковым моделям, потому что названия, условия доступа и тарифы меняются намного быстрее основ технологии. Здесь приведён проверяемый срез рынка и метод выбора, а не рейтинг «лучших моделей».

Если не сказано иначе, цена указана в долларах за миллион текстовых токенов в формате «вход/выход» для стандартного тарифа API. Кэшированный ввод, пакетная обработка, длинный контекст, изображения, звук, поиск и другие инструменты могут тарифицироваться отдельно. У ряда провайдеров внутренние токены рассуждения учитываются в оплачиваемом выводе. Доступность зависит от страны, типа учётной записи и договора, поэтому перед внедрением нужно повторно проверить документацию по ссылкам.

1. Что именно сравнивать

Модель, продукт и endpoint — не одно и то же. Например, название модели в чат-приложении не всегда совпадает с идентификатором в API, а одна и та же модель у двух провайдеров может различаться ограничениями контекста, квантизацией, скоростью, набором инструментов и правилами обработки данных. Указание семейства без точного идентификатора недостаточно для воспроизводимости.

Статус важен не меньше качества. Систему в production обычно безопаснее строить на стабильной (GA) модели, чем на близкой по качеству Preview-модели, которую могут быстро изменить или отключить. Статус deprecated означает, что модель больше не рекомендуется для новых интеграций; дату её отключения нужно проверять отдельно. Если провайдер предлагает обновляемый alias и фиксированный snapshot, первый удобен для экспериментов, а второй — для воспроизводимых прогонов и контролируемых обновлений.

Заявленное контекстное окно не равно полезному. Число в карточке задаёт технический предел, но не гарантирует одинакового качества во всех позициях длинного документа. Проверять нужно полноту извлечения, соблюдение инструкций и стоимость именно на своей длине контекста; подробнее об этом рассказано в главе о контекстном окне.

Бенчмарк не образует универсального пьедестала. Результат зависит от версии набора, способа запуска, бюджета рассуждения, числа попыток и наличия инструментов. Таблицы самих разработчиков полезны как исходная гипотеза, но окончательный выбор следует делать по собственной оценке на реальных данных.

2. Коммерческие API

OpenAI. Текущий флагман gpt-6-astra предназначен для наиболее сложного рассуждения, программирования, работы с компьютером, исследований и создания документов. Он принимает текст и изображения, имеет контекст 1,05 млн токенов, предел вывода 128 тыс. и стоит $10/$50. Для менее дорогих задач остаётся семейство GPT-5.6: gpt-5.6-sol ($4/$20), gpt-5.6-terra ($2/$12) и gpt-5.6-luna ($0,20/$1,20) с теми же пределами контекста и вывода. Тариф Sol промоционный и действует как минимум до 21 ноября 2026 года. Sol рассчитана на сложную профессиональную работу, Terra балансирует качество и стоимость, Luna — на массовые запросы. Alias gpt-5.6 указывает на Sol. На дату обзора карточки не перечисляют отдельных датированных идентификаторов Astra и GPT-5.6, поэтому нужно фиксировать использованный ID, дату и параметры прогона и следить за изменениями документации. Для запросов длиннее 272 тыс. входных токенов действует коэффициент 2 к цене ввода и 1,5 к цене вывода для полного запроса; условия приведены, например, в карточке Astra.

Anthropic. В актуальной линейке Claude верхний уровень занимают claude-fable-5-1 ($10/$50), claude-opus-5 ($5/$25) и claude-sonnet-5. У этих моделей контекст 1 млн и предел вывода 128 тыс. токенов. Стандартный тариф Sonnet 5 составляет $2/$10; ранее намеченное повышение до $3/$15 отменено. Быстрая claude-haiku-4-5-20251001 стоит $1/$5, имеет контекст 200 тыс. и предел вывода 64 тыс. токенов. Fable, Opus и Sonnet поддерживают адаптивное рассуждение; выбирать между ними следует по сложности задачи, задержке и бюджету, а не только по положению в линейке.

Google. Моделью нового поколения для production стала gemini-3.8-flash: статус GA, контекст около 1 млн, вывод до 64 тыс. токенов и настраиваемый уровень рассуждения. До конца 2026 года действует вводный тариф $0,75/$3,75; с 1 января 2027 года заявлен $1,50/$7,50. В каталоге Gemini API Gemini 3.7 Flash уже указан как предыдущее поколение; там также остаются стабильные Gemini 3.6 Flash, 3.5 Flash, 3.5 Flash-Lite и 3.1 Flash-Lite. gemini-3.1-pro-preview всё ещё имеет статус Preview, поэтому его нельзя считать прямой заменой стабильной модели без плана миграции.

xAI. Текущий флагман в документации APIgrok-4.6: текстовый и визуальный ввод, настраиваемое рассуждение, контекст 500 тыс. токенов и тариф $2/$6.

DeepSeek. 10 сентября выпущена DeepSeek V4.1 Flash с нативной поддержкой текста и изображений; актуальный model ID в API — deepseek-flash. Модель поддерживает контекст 1 млн и вывод до 384 тыс. токенов, режимы с рассуждением и без него, JSON, вызов инструментов, Responses API и Anthropic-совместимый API. В руководстве Vision описаны JPEG, PNG, GIF и WebP, передача изображения по URL, в base64 или через Files API. Изображения преобразуются в оплачиваемые входные токены.

По новому прайс-листу DeepSeek, для V4.1 Flash промах кэша и вывод стоят $0,30/$1,20 в пиковые часы и $0,15/$0,60 в остальные; кэшированный ввод — $0,006 и $0,003 соответственно. Пиковыми считаются 01:00–04:00 и 06:00–10:00 UTC с понедельника по пятницу; в выходные действуют внепиковые ставки.

Прежние V4 Flash и V4 Flash Vision Exp имеют статус retired: идентификаторы deepseek-v4-flash и deepseek-v4-flash-vision-exp временно принимаются как aliases V4.1 Flash и тарифицируются по её ставкам. Согласно журналу обновлений, с 14 сентября 2026 года, 04:00 UTC, запросы к deepseek-v4-pro тоже будут направляться в V4.1 Flash по её тарифу — до будущего выпуска V4.1 Pro. До переключения V4 Pro стоит $1,32/$3,96 в пиковые часы и $0,66/$1,98 в остальные. Сохранение прежнего model ID в этих случаях не сохраняет прежнюю модель.

Meta*. 2 сентября выпущена Muse Spark 1.3, ориентированная прежде всего на длительные агентные задачи и программирование. Версия с максимальным уровнем рассуждения доступна через Muse Code и Meta Model API; это отдельная коммерческая линия, и её не следует смешивать с моделями, распространяемыми с весами. Географию доступа, лимиты и действующий тариф нужно проверять в документации Model API.

Даже внутри одного коммерческого семейства более дорогая модель не обязана быть выгоднее. Меньшая модель часто решает классификацию или извлечение с тем же прикладным качеством, но быстрее; флагман окупается на задачах, где снижает число ошибок, повторных запросов и ручных исправлений.

3. Модели с открытыми весами

Открытые веса не означают автоматически открытый исходный код, отсутствие ограничений или возможность дешёвого запуска. Нужно отдельно проверить лицензию, размер активной части MoE-модели, поддерживаемые форматы, объём памяти, качество доступных квантизаций и условия коммерческого использования.

DeepSeek V4.1 Flash и V4. Веса новой V4.1 Flash опубликованы под MIT. Мультимодальная MoE-модель использует архитектуру Causal Encoder–Decoder: 552 млрд параметров основной сети и ещё 196 млрд в памяти Engram. При обработке входа (prefill) активны 8 млрд параметров на токен, при генерации (decode) — 16 млрд; контекст достигает 1 млн токенов. Малое число активных параметров не означает малого объёма весов для локального запуска. Веса предыдущих V4 Pro и V4 Flash также остаются доступны под MIT. У Pro 1,6 трлн параметров всего и 49 млрд активных; у Flash — 284 млрд и 13 млрд соответственно. Это отдельные чекпойнты, которые не обновляются при перенаправлении API-идентификаторов. Старые deepseek-chat и deepseek-reasoner выведены из эксплуатации 24 июля 2026 года.

GLM. После анонса Z.ai опубликовала веса GLM-5.3 на 753 млрд параметров и мультимодальной GLM-5.3-Flash на 320 млрд параметров всего и 18 млрд активных. Полная 5.3 использует ту же базовую модель, что и 5.2, а улучшения получены на этапе post-training; Flash построена на новой гибридной архитектуре и принимает текст и изображения. Лицензии различаются: у GLM-5.3 собственная лицензия Z.ai, у GLM-5.3-Flash — MIT.

Kimi K3. Moonshot AI опубликовала код и описание, а также полные веса мультимодальной MoE-модели с 2,8 трлн параметров всего, 104 млрд активных и контекстом 1 048 576 токенов. Это преемник Kimi K2.x. Веса K3 распространяются по собственной лицензии Moonshot, а не по MIT или Apache 2.0.

Qwen. Флагманская API-модель Qwen3.8 Max нативно мультимодальна и по умолчанию поддерживает контекст 1 млн токенов. Она построена на MoE-модели с 2,4 трлн параметров всего и 95 млрд активных, но доступный чекпойнт Qwen3.8-2.4T-A95B не полностью повторяет API: он принимает только текст, всегда использует режим рассуждения и имеет нативный контекст 262 тыс., расширяемый до 1 010 000 токенов. Веса опубликованы под собственной лицензией Qwen3.8 Max с дополнительными условиями для крупных сервисов. 26 августа опубликованы веса мультимодальной Qwen3.8-Flash-Next: 125 млрд параметров основной модели, ещё 51 млрд в N-граммных эмбеддингах и 6 млрд активных параметров на токен. Её нативный контекст 262 144 токена расширяется до 1 млн; модель служит ранним вариантом архитектуры Qwen4. Веса Flash-Next распространяются под Qwen Community License 1.0. Если компания или её аффилированные лица предоставляют модели как сервис либо выпускают самостоятельные ИИ-продукты для программирования или офисной работы, коммерческое использование требует отдельной лицензии Qwen независимо от выручки. Исключение — внутреннее использование без предоставления модели, её возможностей или результатов третьим лицам. На QwenCloud production-модель Qwen3.8-Flash с контекстом 1 млн заявлена по цене $0,15/$0,47, однако доступность API нужно проверять отдельно. Для ещё более простого развёртывания полезны, например, Qwen3.6-27B и более новая Qwen3.8-27B: мультимодальные dense-модели на 27 млрд параметров под Apache 2.0 с нативным контекстом 262 144 токена. Название Qwen без номера и лицензии теперь особенно малоинформативно.

Mistral. Mistral Small 4 распространяется под Apache 2.0: 119 млрд параметров всего, 6,5 млрд активных (по карточке модели), контекст 256 тыс., текстовый и визуальный ввод, настраиваемое рассуждение; фирменный API стоит $0,15/$0,60. Более крупная Mistral Large 3 также имеет лицензию Apache 2.0, 675 млрд параметров всего, 41 млрд активных и контекст 256 тыс. токенов. Small 4 проще развернуть, чем Large 3, но слово small не означает, что модель поместится на обычную видеокарту без расчёта памяти и квантизации.

Meta* Muse Glimmer. Веса мультимодальной Muse Glimmer на 30 млрд параметров опубликованы под Apache 2.0. Модель предназначена для локальных агентов, программирования и вызова инструментов; разработчик также предоставляет примерно четырёхбитные варианты, рассчитанные на системы с 24 или 32 ГБ памяти. Это локальная модель и не версия коммерческой Muse Spark, несмотря на общее имя Muse.

4. Российские модели и платформы

GigaChat: API и веса нужно различать. В официальном API сейчас перечислены GigaChat 2 Lite, Pro и Max, а также GigaChat 3 Ultra с контекстом 128 тыс. токенов. На 10 сентября 3 Ultra доступна только физическим лицам в режиме Freemium; доступ для платных физических лиц и организаций ещё не открыт. Помимо опубликованной под MIT GigaChat 3.5 432B-A28B, в открытом доступе появилась GigaChat 3.5 Reasoning под той же лицензией: 432 млрд параметров всего, 28 млрд активных и контекст 262 144 токена. Это первая модель GigaChat с полноценным режимом рассуждения, обученная с online RL. Она поддерживает вызов инструментов и структурированный вывод; разработчик отмечает улучшения в математике, программировании и следовании инструкциям по сравнению с GigaChat 3.5 Ultra Instruct. В официальной коллекции доступны веса FP8, BF16 и GGUF. Публикация этих весов не означает появления GigaChat 3.5 Reasoning в публичном API.

Yandex Cloud. В актуальном каталоге доступны Alice AI LLM с контекстом 131 072 токена, Alice AI LLM Flash с контекстом 65 536 токенов, YandexGPT 5 Lite и YandexGPT 5.1 Pro, а Model Gallery включает также модели других разработчиков. Совместимость API с форматом OpenAI появилась 31 марта 2025 года. Совместимый формат упрощает перенос клиента, но не гарантирует полного совпадения параметров, вызова инструментов и семантики ответов.

Другие варианты. T-lite-it-2.1 от T-Tech — компактная русскоязычная модель на основе Qwen3 с открытыми весами, вызовом инструментов и лицензией Apache 2.0. MWS GPT следует рассматривать не как одну базовую модель, а как платформу с каталогом развёртываний и OpenAI-совместимым API.

Российский хостинг и расчёты в рублях могут упростить закупку и локализацию данных, но сами по себе не доказывают соответствие 152-ФЗ или отраслевым требованиям. До передачи персональных, банковских, медицинских или иных чувствительных данных следует проверить договор, место обработки, сроки хранения журналов, использование запросов для улучшения моделей, меры защиты и собственную модель угроз. Точно так же нельзя заранее считать отечественную модель лучшей на русском: это проверяется на корпусе и жанрах конкретной системы.

5. Где запускать модель

API разработчика модели обычно первым получает новые функции, точные идентификаторы и официальную поддержку. Недостатки — зависимость от одного поставщика, его географии, лимитов и политики deprecation и отключения версий. Такой вариант естественен, если нужны уникальные инструменты конкретной модели или договор непосредственно с её владельцем.

Шлюз-агрегатор даёт единый интерфейс, балансировку и резервные маршруты. Например, OpenRouter предоставляет управление выбором провайдера и совместимые с OpenAI endpoints. По его документации, наценки на сам инференс нет, но при покупке кредитов взимается 5,5% (минимум $0,80). Содержимое запросов не журналируется самим OpenRouter по умолчанию, однако запрос всё равно передаётся выбранному провайдеру: его правила хранения и обучения нужно проверять отдельно и закреплять настройками маршрутизации.

Специализированный хостинг открытых моделей снимает с команды управление ускорителями и позволяет выбирать между ценой, задержкой и пропускной способностью. Каталог может быть намного уже агрегаторского: например, официальная страница GroqCloud отдельно помечает production-, preview- и deprecated-модели и публикует скорость, лимиты и цены. Сравнивать нужно конкретный endpoint, а не логотип провайдера.

Самостоятельное размещение даёт максимальный контроль над весами, журналами и обновлениями, но не делает инференс бесплатным. В расчёт входят ускорители и резервирование, энергопотребление, оркестрация, наблюдаемость, обновления движка, проверка квантизации и работа инженеров. Практика локального запуска разобрана в главе 14 учебника.

При сравнении провайдеров проверьте: точный model ID и ревизию весов; максимальный ввод и вывод; поддерживаемые модальности и инструменты; квантизацию; p50 и p95 задержки; лимиты запросов и токенов; кэширование; регион обработки; хранение запросов и ответов; SLA; порядок уведомления о смене цены, deprecation и отключении модели. OpenAI-совместимый URL означает сходную форму запроса, но не функциональную тождественность API.

6. Практический выбор

Для сложного рассуждения и агентного программирования начальный список кандидатов можно составить из GPT-6 Astra, GPT-5.6 Sol, Claude Fable 5.1, Opus 5 или Sonnet 5, Gemini 3.1 Pro Preview, Grok 4.6 и подходящих открытых моделей. Это не порядок качества: состав и результат списка зависят от задачи. Preview-кандидата нельзя переносить в production без оценки риска отключения или изменения, а цена одной попытки ничего не говорит о цене успешно завершённой задачи.

Для массовой классификации, извлечения и преобразования текста сначала тестируйте недорогие модели: GPT-5.6 Luna, Gemini Flash, DeepSeek V4.1 Flash, Mistral Small 4 и компактные Qwen. Крупный флагман стоит подключать, если измеримый выигрыш покрывает разницу в стоимости и задержке.

Для изолированного контура выбирайте не самое громкое открытое имя, а модель, которая помещается в имеющуюся инфраструктуру с требуемой длиной контекста и качеством. Qwen3.6-27B, Qwen3.8-27B, Muse Glimmer и T-lite-it-2.1 заметно проще для начала, чем DeepSeek V4.1 Flash, V4 Pro, Kimi K3 или Qwen3.8-2.4T-A95B. Малое число активных параметров Qwen3.8-Flash-Next или GLM-5.3-Flash снижает вычисления на токен, но не отменяет требования памяти для размещения весов. Для регулируемого облачного контура сначала отбирают допустимые договоры и регионы, а уже затем сравнивают модели внутри этого множества.

Для длинных документов не сортируйте кандидатов только по числу токенов. Измерьте долю найденных фактов на разных позициях, устойчивость к противоречащим фрагментам, задержку и полный счёт. Иногда RAG с меньшим окном надёжнее и дешевле прямой загрузки всего архива.

Минимальная прикладная оценка должна включать:

  1. набор реальных задач, включая редкие и опасные случаи;
  2. критерии правильности и перечень неприемлемых ошибок;
  3. одинаковые инструменты, промпты и бюджеты рассуждения либо явное обоснование различий;
  4. качество, p50/p95 задержки и стоимость успешно решённого случая с учётом повторов, кэша и вызовов инструментов;
  5. проверку структурированного вывода, вызова инструментов, длинного контекста и целевых языков;
  6. проверку безопасности, лицензии, обработки данных и доступности по договору;
  7. повторный прогон при каждой смене модели, snapshot, провайдера или параметров инференса.

Методика построения таких тестов приведена в главе об оценке качества, а переносимый слой работы с моделями — в главе об API. Практически полезная архитектура хранит model ID, адрес API и параметры в конфигурации, умеет ограничивать расходы и имеет проверенный резервный маршрут. При темпе изменений 2026 года это не преждевременное усложнение, а условие нормальной эксплуатации.

Все числа и статусы сверены по официальной документации и карточкам разработчиков 10 сентября 2026 года. Результаты сторонних рейтингов намеренно не использованы: они быстро меняются и не заменяют оценку на данных конкретной системы.

* Компания Meta Platforms Inc. признана экстремистской организацией, её деятельность запрещена на территории Российской Федерации.

404 Not Found

404 Not Found


nginx/1.24.0 (Ubuntu)

Связь с редакцией