обучение моделейСбросить фильтр ×

Amazon скупает редкие книги, чтобы уничтожить их после сканирования для обучения ИИ Nova

Журналисты выяснили, кто стоит за скупкой и уничтожением бумажных раритетов ради обучения нейросетей: спрятанный в редкой книге трекер привёл к складу Amazon в Лас-Вегасе. Там книги, купленные у букинистов, не хранят для продажи, а вспарывают и оцифровывают — так компания кормит свою модель Novai.

Проект Internet Archivei пытается спасти издания от такой судьбы: волонтёры вручную сканируют книги, которым грозит уничтожение, и выкладывают копии в открытый доступ.

Полный разбор →

Figure AI собрала крупнейший в мире датасет видео для обучения роботов через приложение Index

Стартап человекоподобных роботов Figure AI четыре месяца в закрытом режиме тестировал приложение Indexi, через которое обычные люди записывают видео повседневных бытовых задач — мытьё посуды, уборка, работа по дому — и получают за это деньги. Собранные ролики уже используются для обучения модели Helixi, лежащей в основе роботов Figure.

Проблема, которую решает Index: если языковые модели обучают на текстах, которых в интернете полно, то для роботов не хватает данных в формате POV о том, как человек выполняет обычные бытовые действия. Приложение уже доступно в AppStore и GooglePlay, а масштаб сбора данных Figure планирует увеличить ещё в 100 раз.

$15 млнвыплачено пользователям за видео
264 000скачиваний приложения Index
>$1 млрдпланируемые расходы на данные и вычисления в след. году

Полный разбор →

Google планирует купить данные обанкротившейся Spirit Airlines для обучения AI

G@aiofthedayAI-инженер
2 дн

Проблемы train-inference mismatch в MoE моделях при RL

A@AIexTimeAI-инженер
3 дн

Google купила у банкрота Spirit Airlines архив писем и чатов сотрудников за $10 млн — данные пойдут на обучение ИИ

$10 млнцена, за которую Google купил данные Spirit Airlines

Обанкротившийся 1 мая крупнейший американский лоукостер Spirit Airlines стал источником нового вида актива: его внутренние корпоративные данные — письма, чаты, финансы, код — были проданы на банкротном аукционе. Победителем стал Google, предложивший $10 млн; данные пойдут на разработку продуктов и обучение ИИ-моделей.

Случай показывает, что рынок ИИ-данных переходит от бесплатного скрапинга публичного интернета и лицензирования качественного контента (как у News Corp или Financial Times) к покупке операционных данных умерших компаний — переписки, регламентов, истории решений. Это нужно, чтобы учить не просто отвечающие модели, а ИИ-агентов, способных управлять реальными бизнес-процессами.

100 млнколичество корпоративных писем в пакете данных
$12,5 млнконкурирующая ставка стартапа Micro1

Полный разбор →

Amazon скупает и уничтожает редкие книги после сканирования для обучения ИИ — расследование 404 Media

Журналисты 404 Media подтвердили подозрения букинистов: аномально высокий спрос на подержанные книги по всему миру связан не только с читателями, но и с ИИ-компаниями, которым нужны «чистые» данные для обучения нейросетей. Спрятав Apple AirTagi в партию редких изданий, купленных через букиниста, журналисты выяснили, что заказ пришёл на склад Amazon — там книги разрезают для быстрого сканирования и затем утилизируют.

Это продолжение истории с Anthropic, которая ранее скупала, сканировала и уничтожала миллионы бумажных книг для обучения своих моделей; суд признал такую практику «добросовестным использованием». Теперь похожая схема обнаружена у Amazon, а активисты из Anna's Archive призывают волонтёров массово сканировать книги, чтобы сохранить их в открытом доступе, прежде чем их скупят и уничтожат ИИ-лаборатории.

1,5 млрдсумма мирового соглашения по иску против Anthropic
2022год, до которого книги считаются «чистыми» от ИИ

Полный разбор →

Explorative Modeling: новый подход к обучению генеративных моделей

Б@boris_againAI-инженер
1 нед

Twitch включил стримерам по умолчанию согласие на обучение ИИ Amazon

Twitch добавил в панель управления каналом новый пункт: записи трансляций и другой контент каналов теперь используются для обучения генеративных ИИ-моделей Amazon (владельца сервиса). Настройка активирована по умолчанию у всех авторов без явного запроса согласия — отключить её можно только вручную в разделе безопасности и приватности.

Решение вызвало волну критики среди стримеров: сотрудники Twitch публично признали, что сделали функцию обязательной по умолчанию именно потому, что при добровольном согласии («opt-ini») никто бы её не включил.

десятки тысячподписей под петицией против функции

Полный разбор →

Проблемы сертификации LLM на соответствие культурным ценностям

D@dealerAIAI-инженер
2 нед

Исследователи заподозрили Kimi в обучении на скрытых рассуждениях Claude

2 нед
Исследователи заподозрили Kimi в обучении на скрытых рассуждениях Claude

Dyna Robotics представила ИИ-модель DYNA-2 для роботов

Х@htech_plusисследователь
2 нед

AI-стартапы скупают редкие книги для обучения моделей

Д@disruptors_officialмедиа / агрегатор
2 нед

Сравнение устойчивости алгоритмов CISPO и DAPO при обучении моделей

A@AIexTimeAI-инженер
1 мес
Какое-то время назад открыл для себя, насколько CISPO робастнее к выбору гиперпараметров по сравнению с DAPO и насколько он по дефолту работает лучше в async режиме. На async в 64 шага дефолтный DAPO деградирует безумно сильно, да и на 16 уже заметно Для Qwen3 30B MoE картина та же, только коллапс в async происходит еще раньше из-за проблем с разным роутингом экспертов
Сравнение устойчивости алгоритмов CISPO и DAPO при обучении моделей
Ещё ↓