датасетыСбросить фильтр ×

Анализ датасета и качества генерации Treblo в сравнении с Suno

М@cgeventAI-инженер
2 нед

ShieldFont — бесплатный шрифт, который «отравляет» тексты для ИИ-скрейперов

Бразильское агентство Seneda & Abrucio и датская студия Playtype выпустили бесплатный шрифт ShieldFont, который решает проблему массового сбора текстов ИИ-ботами для обучения нейросетей. Технология подменяет глифы в HTML-коде страницы так, что человек видит нормальный связный текст, а ИИ-парсер, читающий исходный код, получает грамматически правильный, но фактически бессмысленный набор слов.

Цель проекта — не просто защита сайта, а экономический саботаж: авторы рассчитывают, что если очистка датасетiов от таких «ловушек» станет слишком дорогой, крупные ИИ-компании будут вынуждены платить издателям за легальный доступ к контенту.

25%доля подменяемых слов в HTML
55,8%доля искажённых по смыслу отрывков в тестах
250число групп для замены слов

Полный разбор →

Экс-сотрудник OpenAI запускает стартап для создания обучающих данных

4 нед
Экс-сотрудник OpenAI запускает стартап для создания обучающих данных

Стартап Ropedia привлек $22 млн на сбор данных для обучения роботов

N@NeuralShitAI-инженер
1 мес

Дискуссия о рисках для авторов ML-датасетов

K@rybolos_channelAI-инженер
1 мес
Илья мб и грубовато написал, но в целом весь ML опен сорс держится на людях, которые бесплатно трудятся и берут на себя такие огромные риски. Если каждый ресурс будет кошмарить авторов датасетов, никаких открытых LLM не будет. Удивительно это видеть от Хабра. Американское же прецедентное право в этом смысле очень явно выразилось: это Fair use.

Как ИИ-компании покупают данные из реальной жизни, когда интернет заканчивается

На фоне бума ИИ сформировалась целая индустрия по добыче «свежих» данных для обучения нейросетей: интернета, книг и форумов, по оценкам двухлетней давности, осталось на ~300 триллионов токенов, и они полностью закончатся в 2026–2032 году. Поэтому стартапы стали платить людям за видео повседневных действий, записи разговоров, архивы переписок закрывшихся компаний и экспертную разметку — превращая «каждый чих» пользователя в товар для обучения моделей.

Эта ниша уже включает несколько специализированных игроков: одни собирают бытовые видео и звуки, другие — поведение людей на видеозвонках, третьи скупают корпоративные архивы, а четвёртые нанимают врачей и юристов для оценки ответов ИИ. Спрос на такие сервисы особенно высок в странах с низким доходом, где даже небольшие выплаты в валюте становятся заметным заработком.

~300 триллионов токеновоставшийся объём текстовых данных в мире
2026-2032прогноз исчерпания данных для обучения LLM
3 млн файлов в деньзагрузки пользователей Kled AI

Полный разбор →

Это всё на сейчас.