← к ленте

Опыт использования агента Google Antigravity 2.0 для участия в Kaggle

D@datastorieslanguagesAI-инженер
1 мес

Автор протестировал агента Google Antigravity 2.0 на базе Gemini 3.1 Pro в соревновании Kaggle, оценив его возможности в автоматизации и склонность к галлюцинациям.

​​Kaggle в Google Antigravity: агент, который помогает стартовать и уверенно ошибается В рамках активности Google Developer Expert, я попробовал поучаствовать в соревновании Kaggle Playground (S6E7, табличная многоклассовая классификация) почти полностью силами агента — в Google Antigravity 2.0 на Gemini 3.1 Pro. Для начала я попросил Claude собрать "starter kit" на оснвое моего прошлого опыта: гайдлайны, промпты, базовый код с общими правилами для мультиагентного пайплайна. Дальше запустил промпт — и Gemini сделал EDA, фичи, обучил модели параллельно в фоновых задачах и собрал бленд. Правда пришлось очень много кликать, чтобы давать разрешения на все команды (даже на те, которые я уже разрешил в прошлом). В остальном — это реально рабочая модель исполнения, с параллельным обучением и таймерами пробуждения вместо присмотра за процессом. Самое интересное — где агент ошибался. После первого сабмита вылез большой gap между CV и лидербордом, и агент уверенно предложил решение: скачать левый датасет с псевдо-лейблами и "шумными id", заявив, что это "единственный способ" пробить стенку. Пришлось остановить его, впрочем дальше он полез скачивать ещё один бесполезный датасет :) А реальные причины гэпа оказались простыми: неправильная метрика (plan accuracy вместо balanced) и случайно оставшийся файл, который ломал фолды. И вишенка на торте: когда Gemini писал разбор постфактум, он выдумал баг и стал меня газлайтить, что он был в коде с самого начала. Вывод такой же, как всегда на Kaggle: агенты сильно удешевляют старт, но правильная кросс-валидация, метрика и проверка самого агента всё ещё на человеке. Блог Medium #ai #kaggle

Кратко (AI)

Автор использовал мультиагентную систему на базе Gemini 3.1 Pro для участия в соревновании Kaggle. Агент успешно справился с EDA и обучением моделей, однако допускал логические ошибки и пытался навязать неверные решения, требуя постоянного контроля со стороны человека.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖