Выпуск Grok 4.6: API, цены, контекст 500K и руководство

Проверенное руководство по Grok 4.6: точный ID, контекст 500K, цены токенов, уровни рассуждения, примеры API, стартовые бенчмарки и миграция.

xAI выпустила Grok 4.6 12 августа 2026 года. Официальное руководство указывает ID модели API grok-4.6, контекстное окно 500 000 токенов, текст и изображения на входе, текст на выходе и четыре уровня рассуждения: low, medium, high (по умолчанию) и xhigh.

Для разработчиков важны не только стартовые бенчмарки. Grok 4.6 работает через Responses API и Chat Completions, переходит на тариф длинного контекста при 200 000 токенов промпта и требует явного управления привязкой к кэшу и контекстом в длительных агентных процессах.

В этом руководстве официальные характеристики xAI отделены от опубликованных поставщиком результатов и от текущей доступности в Modelflare. Цены и доступность могут измениться; все нестабильные данные проверены 13 августа 2026 года.

Краткие характеристики Grok 4.6

Свойство Официальное значение
Дата выпуска 12 августа 2026 года
ID модели API grok-4.6
Контекстное окно 500 000 токенов
Дата отсечения знаний 1 февраля 2026 года
Модальности Текст и изображения на входе; текст на выходе
Лимит текстового вывода xAI не указывает фиксированного лимита
Уровень рассуждения low, medium, high (по умолчанию), xhigh
Форматы API Responses API и Chat Completions
Возможности в документации Вызов функций, структурированный вывод, веб-поиск, поиск по X, выполнение кода

«Без фиксированного лимита текстового вывода» — описание на странице модели, а не обещание неограниченного ответа для любого SDK, шлюза, аккаунта или запроса. Тайм-аут клиента, ограничения аккаунта, политика маршрута и доступный контекст продолжают действовать.

Что изменилось по сравнению с Grok 4.5

xAI представляет Grok 4.6 как постепенное обновление frontier-модели с акцентом на длительно работающих агентов и более сложные интерактивные и визуальные задачи. В официальном анонсе описаны более длительное дополнительное обучение, заново созданные траектории SFT и агентное обучение с подкреплением для работы со знаниями, программирования, веб-разработки, оптимизации ядер и CAD.

На практике стоит проверить следующие изменения:

  • к уровням low, medium и high добавлен xhigh;
  • xAI заявляет о лучшей непрерывности при многошаговых исследованиях, работе с кодовой базой и итеративной разработке приложений;
  • модель принимает изображения вместе с текстом и выдаёт текст;
  • класс контекста 500K и стартовые стандартные цены $2 за ввод и $6 за вывод сохранились, но кэшированный ввод Grok 4.6 стоит $0,50 за миллион против текущих $0,30 для Grok 4.5;
  • xAI рекомендует привязку кэша к диалогу и сжатие контекста для длинных агентных циклов.

Это основания для контролируемой миграции, а не для слепой замены Grok 4.5. Сравнивайте успешность задач, задержку, общее число токенов, вызовы инструментов и стоимость на собственной нагрузке.

Цены API Grok 4.6

Страница цен xAI указывает следующие стандартные цены в долларах США за миллион токенов:

Размер промпта Ввод Кэшированный ввод Вывод
Менее 200K токенов промпта $2.00 $0.50 $6.00
200K токенов промпта и более $4.00 $1.00 $12.00

Когда промпт достигает 200K токенов, по данным xAI тариф длинного контекста применяется ко всем токенам запроса. Три расчёта показывают эффект границы:

  • 100K ввода и 5K вывода стоят около $0.23 по стандартному тарифу короткого контекста.
  • Если все 100K входных токенов взяты из кэша, тот же вывод стоит около $0.08.
  • 220K ввода и 10K вывода пересекают порог и стоят около $1.00 по указанному тарифу длинного контекста.

В примеры не включены серверные инструменты. Сейчас xAI дополнительно к токенам указывает $5 за 1 000 вызовов веб-поиска, поиска по X или выполнения кода. В анонсе также упомянут быстрый вариант по удвоенной стандартной цене. Перед составлением бюджета проверьте точную модель, уровень сервиса, региональную доступность и текущую цену в консоли xAI.

Общий подход к расчётам описан в статьях Как рассчитать стоимость токенов LLM и Отслеживание стоимости API ИИ.

Вызов Grok 4.6 через Responses или Chat Completions

Следующие запросы используют официальный endpoint xAI, поскольку это руководство по выпуску, а не утверждение, что модель уже активна в каждом шлюзе.

Responses API:

export XAI_API_KEY="<YOUR_XAI_API_KEY>"

curl -sS https://api.x.ai/v1/responses \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "input": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps.",
    "prompt_cache_key": "grok-46-migration-review"
  }'

Chat Completions:

curl -sS https://api.x.ai/v1/chat/completions \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -H "x-grok-conv-id: grok-46-migration-review" \
  -d '{
    "model": "grok-4.6",
    "messages": [
      {
        "role": "user",
        "content": "Review this migration plan, identify the three highest-risk assumptions, and propose verification steps."
      }
    ]
  }'

Используйте prompt_cache_key в Responses или заголовок x-grok-conv-id в Chat Completions, чтобы улучшить привязку диалога к кэшу. Относитесь к этим значениям как к операционным метаданным: сохраняйте их в одном диалоге, не включайте секреты или персональные данные и не используйте одно значение для несвязанных пользователей.

Выбрать транспортный формат поможет статья Responses API или Chat Completions.

Кэширование промпта и длинные агентные циклы

Окно 500K — это ёмкость, а не цель. Передача всей истории на каждом шаге увеличивает задержку и может перевести весь запрос на тариф длинного контекста.

Для длительных процессов:

  1. размещайте стабильные инструкции и повторно используемый контекст в начале промпта;
  2. используйте стабильный ключ привязки к кэшу для каждого диалога;
  3. измеряйте кэшированный и некэшированный ввод отдельно;
  4. сжимайте или суммируйте старые шаги до приближения к 200K токенов;
  5. сохраняйте актуальные авторитетные результаты инструментов и удаляйте дублирующий транспортный шум;
  6. задавайте уровень рассуждения и сравнивайте успех задач, не считая xhigh всегда лучшим;
  7. записывайте статус, задержку, ввод, кэшированный ввод, вывод, вызовы инструментов и общую цену успешной задачи.

Сжатие контекста меняет информацию, которую видит модель. Проверяйте сводки по исходному состоянию и сохраняйте авторитетные ID, ограничения, решения и нерешённые ошибки.

Как интерпретировать стартовые бенчмарки

xAI опубликовала в анонсе следующие результаты Grok 4.6 High:

Оценка Результат Grok 4.6 по данным xAI
Artificial Analysis Intelligence Index 61
GDPVal-AA v2 1753
CursorBench v3.2 69.9%
DeepSWE v1.1 65.9%
FrontierCode v1.1 Extended 61.3%
APEX-Agents 57.5%

Это результаты запуска, опубликованные поставщиком, а не независимые тесты Modelflare. Среда теста, настройки рассуждения, доступ к инструментам, лимит времени и версия оценки влияют на сравнимость. Используйте таблицу для выбора собственных тестов, а не как универсальный рейтинг или гарантию работы в production.

Контрольный список миграции в production

До направления production-трафика на Grok 4.6:

  1. используйте точный ID grok-4.6 и запрещайте незаметную подмену псевдонимом;
  2. подтвердите доступность модели для нужного аккаунта, региона, формата API и уровня сервиса;
  3. воспроизведите фиксированный набор без персональных данных на Grok 4.5 и Grok 4.6;
  4. отдельно проверьте текст, изображения, вызов функций, структурированный вывод, streaming, отказы и отмену согласно сценарию приложения;
  5. сравните low, medium, high и xhigh по стоимости и задержке успешной задачи;
  6. протестируйте запросы непосредственно ниже и выше порога 200K;
  7. проверьте попадания в кэш, сжатие, число инструментов, повторы и защиту от двойных побочных эффектов;
  8. сохраните маршрут отката и записывайте итоговую модель, маршрут, использование, задержку и списание каждого запроса.

HTTP 200 доказывает только завершение одного запроса. Он не доказывает равенство функций, стабильную задержку, правильную работу инструментов или приемлемую стоимость. Для проверки маршрутов используйте Тесты совместимости OpenAI-совместимых API и Надёжную маршрутизацию API ИИ.

Доступен ли Grok 4.6 в Modelflare?

Да. При production-проверке 13 августа 2026 года публичный каталог Modelflare Модели и цены содержал точный ID grok-4.6 в группах grok-award и grok-stable. В каталоге заявлены OpenAI-совместимые маршруты Chat Completions и Responses API.

На момент проверки отображались множители 0,03x для grok-award и 0,06x для grok-stable. Доступ к группам, маршруты, цены и наличие могут измениться. Поскольку xAI отдельно применяет тариф длинного контекста, нельзя распространять один рекламный множитель или пример короткого контекста на все запросы. Актуальным источником служат живая страница цен и запись стоимости завершённого запроса.

Создайте или обновите API Key с доступной группой, используйте точный ID grok-4.6 и завершите реальный запрос без чувствительных данных перед переносом production-трафика. Каталог подтверждает публичную конфигурацию, но не является независимым бенчмарком Modelflare и не гарантирует доступ для каждого API Key.

Официальные источники и журнал обновлений

Первичные источники:

Журнал обновлений:

  • 13 августа 2026 года: Первая публикация. Проверены официальные характеристики, цены, форматы API, стартовые бенчмарки и доступность в каталоге Modelflare.