← к ленте

Выход модели Grok 4.6: фокус на агентах и офисных задачах

A@ai_productAI-инженер
2 нед

Релиз Grok 4.6 с упором на долгоживущие агенты, визуальную работу и высокую производительность в офисных задачах при низкой цене.

Появление доступного и эффективного ИИ-агента для офисной рутины меняет стандарты работы с документами.

  • Снижение стоимости автоматизации обработки договоров и отчетов.
  • Улучшение качества работы ИИ-агентов, способных выполнять многошаговые задачи без участия человека.
  • Высокая конкуренция среди моделей приводит к быстрому росту производительности при сохранении низких цен для бизнеса.
Grok 4.6 вышел Главный фокус – долгоживущие агенты и интерактивная/визуальная работа: модель должна держать задачу на много шагов, а не выдавать один хороший ответ. – AA Intelligence Index: 61 против 56 у Grok 4.5. Это ровно уровень GPT-5.6 Sol Max (61) и почти Fable 5 Max (62). Скачок за месяц серьёзный. Прикольно, что в табличке в скриншоте не боятся показывать бенчмарки, на которых не занимают 1 места. Сейчас все в тройке, но при этом цена вообще мизерная - $2 / $6 за 1M токенов, есть fast-вариант вдвое дороже. Первую неделю – 2x включённого лимита в Grok Build и Cursor. – Доступ сразу везде: Cursor, Grok Build, API, OpenRouter, Vercel, Cloudflare. – Тренировали интересно: Grok 4.5 использовали, чтобы перегенерировать SFT-траектории для 4.6, а мусорные трейсы отфильтровали модельными проверками. Модель учит модель. В кодинге пока чуть отстает, а вот в работе белых воротничков - лидер: GDPval-AA v2 — 1753 (у Fable 1741, у GPT 1728), AA-Briefcase – 1577, и особенно Harvey LAB на юридических задачах: 15.8% против 11.3% у Fable и 2.5% у GPT-5.6. Разрыв в шесть раз. Кажется это сейчас лучший вариант для длинных агентов над документами и офисной работой: разбор договоров, заявок, отчётности. x.ai/news/grok-4-6
Выход модели Grok 4.6: фокус на агентах и офисных задачах

Кратко (AI)

Компания x.ai выпустила модель Grok 4.6, ориентированную на многошаговые агентские задачи и работу с документами. Модель показывает высокие результаты в офисных и юридических тестах, обходя конкурентов, при этом сохраняя низкую стоимость использования.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖