ИИ

Архитектура памяти для AI-агентов: анализ подходов

Ц@transform_the_energyAI-инженер
2 мес

Анализ производительности и стоимости Claude Fable 5 в агентных цепочках

T@kryak_startupAI-инженер
2 мес

Анализ стоимости доступа к LLM в России: сравнение с OpenRouter

М@ITcanflyавтор про «it»
2 мес

Cloudflare тестирует инструменты монетизации контента для ИИ

v@vcnewsмедиа / агрегатор
2 мес
Cloudflare рассказала, что совместно с You.com и Ceramic.ai тестирует инструменты, которые позволят владельцам сайтов взимать плату за использование их контента в ответах ИИ. Экспериментируют с двумя подходами. «Оплата за запрос» позволит издателям получать вознаграждение каждый раз, когда их контент попадает в ответы ИИ. «Оплата по требованию» предполагает выплаты за конкретные фрагменты контента без долгосрочных обязательств vc.ru/ai/3007648

Эксперимент Andon Labs: ИИ-менеджер Мона и провал управления кофейней

N@NeuralShitAI-инженер
2 мес

Проблемы экосистемы ComfyUI в генеративном видео

М@cgeventAI-инженер
2 мес

Упс, они сделали это снова? Почему ваш ИИ тупеет ровно перед выходом новой модели

N@neuro_art0AI-инженер
2 мес

Обзор новостей ИИ: OpenAI, Meta, Илон Маск, Base44 и рост цен в Сан-Франциско

2 мес

Zhipu AI обновила ИИ-агента ZCode до версии 3.2

v@vcnewsмедиа / агрегатор
2 мес
Китайская Zhipu AI обновила ИИ-агента для написания кода ZCode. Теперь это «официальная среда разработки» для GLM-5.2 — вирусной модели, которую некоторые считают конкурентом GPT-5.5 и Claude Opus 4.7. В ZCode v3.2 увеличили лимиты в 1,5 раза и добавили интерфейс для плагинов. Также можно управлять ИИ-агентом через Telegram и WeChat vc.ru/ai/3007326

Adobe представила Firefly Graph для визуальной сборки ИИ-процессов

Н@GreenNeuralRobotsAI-инженер
2 мес
Firefly Graph Adobe представили нодовую среду для сборки ИИ-процессов 300+ нод дают к моделям ИИ от Adobe Firefly и ведущих сторонних поставщиков, а также к профессиональным действиям редактирования из Photoshop, Illustrator, Premiere и других приложений Группы нод можно сворачивать в подграфы Работает в Adobe Creative Cloud для предприятий граждане первого сорта или притворяющиеся ими могут попроситься в вейтлист #news

Стендап-монолог нейросети Fable 5

D@denissexyAI-инженер
2 мес

Инсайты с конференции Conversations: запросы реального сектора и байки из индустрии

A@oestickAI-инженер
2 мес

Onklaud 5: новый конвейер для кодинга

Н@GreenNeuralRobotsAI-инженер
2 мес
Onklaud 5 Конвейер для кодинга, сопоставимый с Fable5 при цене в 100 раз меньше. 57% задач решаются бесплатно благодаря проверке стандартных библиотек. Объединяет три модели: Kimi K2.7, GLM 5.2, DeepSeek V4 Pro GLM проектирует архитектуру, Kimi генерирует код, обе модели проверяют его. При разногласиях GLM выступает арбитром. Quality Gate блокирует всё ниже 10/10. #coding

Продажа пользовательских данных для обучения ИИ

v@vcnewsмедиа / агрегатор
2 мес
Переписки в Slack, задачи в Jira, записи шумов с прогулки, групповые звонки, ролики с походом на помойку — всё это можно продать для обучения ИИ, потому что открытых данных разработчикам давно мало. Какие стартапы выкупают пользовательские данные и можно ли заработать на продаже своих — в обзоре vc.ru/ai/3004349

Fable 5 показала рекордные результаты в бенчмарке Remote Labor Index

AI-редакция
2 источника · показать все· свернуть
собирается · 2обновлено 2 мес назад

Center for AI Safety (CAIS) обновил результаты бенчмарка Remote Labor Index (RLI), предназначенного для оценки качества ИИ-агентов в задачах удаленной работы. Бенчмарк базируется на реальных проектах фрилансеров с платформы UpWork, а результаты моделей оцениваются путем сравнения с работой живых специалистов.

Лидером тестирования стала модель Fable 5, набравшая 16,1% (по данным CodeCamp). Для сравнения, показатели других актуальных моделей значительно ниже: Opus 4.8 набрал 8,3%, а GPT-5.5 — 6,3%. При этом на момент запуска бенчмарка лучшие решения справлялись лишь с 2,5% задач. Fable 5 продемонстрировала особые успехи в 3D, CAD, визуализации и редактировании видео.

Стоимость выполнения одной задачи в рамках теста была ограничена 50 долларами для большинства моделей и 150 долларами для Fable. По оценкам GPT-5.2 Pro, каждый процент прироста в RLI коррелирует с потенциальным влиянием на рынок труда США в диапазоне от 13 до 54 миллиардов долларов, в зависимости от охвата сегментов удаленной работы.

В дальнейшем CAIS планирует внедрить систему «критика», которая будет проверять результаты работы ИИ перед их финальной оценкой. Также исследователи намерены изучить зависимость эффективности выполнения задач от масштабирования вычислительных мощностей и финансовых затрат.

Изменения в графиках статьи Claude Sonnet 5

D@datastorieslanguagesAI-инженер
2 мес
​​Интересное изменение графиков в статье Sonnet 5 https://www.anthropic.com/news/claude-sonnet-5 Внимательный читатель может заметить, что графики в статье очень сильно изменились. Официальное оправдание "сорри, не тот график опубликовали". Неужели вайб-кодили и сделали ошибку?! Видимо забыли добавить "make no mistakes"! #ai
Ещё ↓