Андрей Карпати предложил новый бенчмарк для оценки ИИ через генерацию кода
M@ai_machinelearning_big_dataAI-инженер
3 недАндрей Карпати предложил использовать генерацию сложных интерактивных миров на Three.js как новый стандарт для тестирования мультимодальных ИИ-моделей.
Появление более сложных методов оценки ИИ меняет подход к измерению их реальных способностей.
- Традиционные тесты на логику и рисование становятся слишком простыми для современных моделей.
- Генерация работающего программного кода для интерактивных сред лучше отражает способность ИИ к планированию и реализации сложных задач.
- Разработчики получают новый ориентир для оценки качества моделей в задачах, требующих долгосрочной логики и визуализации.
✔️ Андрей Карпати предложил новый бенчмарк для ИИ
Он использовал модель Opus 5, чтобы превратить абзац из книги "Властелин колец" в 5500 строк кода браузерной графической библиотеки Three.js.
Генерация сцены заняла около 2-х часов, потребовала миллион токенов и обошлась примерно в 10 долларов. Звук был сгенерирован через ElevenLabs.
По мнению Карпати, привычные тесты на пространственное мышление вроде рисования пеликана на велосипеде в SVG окончательно устарели. Современные мультимодальные модели справляются с ними без труда.
Генерация целых интерактивных миров с помощью кода, по мнению Андрея, может стать новым стандартом оценки возможностей ИИ.
Пока главным препятствием для идеального результата остается отсутствие у модели возможности анализировать собственный видеовыход - сейчас она вынуждена опираться на скриншоты, из-за чего в рендере возникают ошибки.
@ai_machinelearning_big_data
#news #ai #ml
Кратко (AI)
Андрей Карпати предложил новый подход к тестированию ИИ, основанный на генерации сложных интерактивных 3D-сцен с помощью кода. Он продемонстрировал этот метод, создав сцену из «Властелина колец» на Three.js с помощью модели Opus 5, и отметил, что текущие тесты на пространственное мышление уже неактуальны.
Обсуждение
0Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖