← к ленте

Андрей Карпати предложил новый бенчмарк для оценки ИИ через генерацию кода

3 нед

Андрей Карпати предложил использовать генерацию сложных интерактивных миров на Three.js как новый стандарт для тестирования мультимодальных ИИ-моделей.

Появление более сложных методов оценки ИИ меняет подход к измерению их реальных способностей.

  • Традиционные тесты на логику и рисование становятся слишком простыми для современных моделей.
  • Генерация работающего программного кода для интерактивных сред лучше отражает способность ИИ к планированию и реализации сложных задач.
  • Разработчики получают новый ориентир для оценки качества моделей в задачах, требующих долгосрочной логики и визуализации.
✔️ Андрей Карпати предложил новый бенчмарк для ИИ Он использовал модель Opus 5, чтобы превратить абзац из книги "Властелин колец" в 5500 строк кода браузерной графической библиотеки Three.js. Генерация сцены заняла около 2-х часов, потребовала миллион токенов и обошлась примерно в 10 долларов. Звук был сгенерирован через ElevenLabs. По мнению Карпати, привычные тесты на пространственное мышление вроде рисования пеликана на велосипеде в SVG окончательно устарели. Современные мультимодальные модели справляются с ними без труда. Генерация целых интерактивных миров с помощью кода, по мнению Андрея, может стать новым стандартом оценки возможностей ИИ. Пока главным препятствием для идеального результата остается отсутствие у модели возможности анализировать собственный видеовыход - сейчас она вынуждена опираться на скриншоты, из-за чего в рендере возникают ошибки. @ai_machinelearning_big_data #news #ai #ml

Кратко (AI)

Андрей Карпати предложил новый подход к тестированию ИИ, основанный на генерации сложных интерактивных 3D-сцен с помощью кода. Он продемонстрировал этот метод, создав сцену из «Властелина колец» на Three.js с помощью модели Opus 5, и отметил, что текущие тесты на пространственное мышление уже неактуальны.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖