ИИ

ScreenPipe: локальный ИИ для записи и анализа активности экрана

С@sergiobulaevAI-инженер
1 мес

Интервью с Дмитрием Ушановым из Т-Банка: AI-агенты и трансформация процессов

D@data_secretsAI-инженер
1 мес

Запуск языковой модели на микроконтроллере ESP32-S3

N@NeuralShitAI-инженер
1 мес
Смотрите, какой-то умелец запустил языковую модель на ардуиноподобной плате за восемь баксов (ESP32-S3) Внутрь удалось утрамбовать модельку на 28,9 миллиона параметров. Она занимает около 15 мегабайт памяти, работает офлайн и генерит текст со скоростью примерно 10 токенов в секунду. Яснопонятно, что это не карманный ChatGPT. Модель обучена на датасете TinyStories и умеет в основном сочинять простенькие и небольшие рассказы. Вопросы, программирование и захват человечества пока не завезли. Но сам факт всё равно годный: теперь даже на железе за цену шавухи можно генерировать связный текст. тут исходники и вся инфа

Впечатления от обновления голосового режима

E@elkornacioAI-инженер
1 мес
апдейт долетел и до меня 🙂 в общем, он юзает свою модель, а не проксирует в 5.6 Sol/Terra/Luna. и он весьма туповат( и акцент лютый, и ответы медленные. в общем, думаю через 1-1.5 года будет прям сок - когда он будет хорошо быстро разговаривать, а агентную активность будет выполнять норм модель. может на выходных попробую его завезти как оркестратора над чатами с норм моделями.

Anthropic меняет условия доступа к Claude Fable 5 и, по наблюдениям пользователей, режет лимиты Opus 4.8

Anthropic отказалась от идеи полностью убрать модель Claude Fable 5 из подписок, но разделила условия доступа по тарифам. С 20 июля модель официально закреплена как постоянная часть подписок Max и Team Premium (лимит — до 50% недельной квоты), а подписчики Pro и Team Standard теряют доступ к ней в рамках подписки и получают разовый кредит в $100 на оплату по usage-based billingi, после чего платят отдельно по тарифам, близким к API.

Параллельно пользователи фиксируют, что реальные лимиты по флагманской модели Opus 4.8 стали сокращаться от недели к неделе, хотя расход токенов падает — это может означать скрытое ужесточение квот вне официальных объявлений Anthropic.

$100разовый кредит для Pro/Team Standard
50%лимит Fable 5 в подписках Max и Team Premium
3848 Mтокенов за неделю до упора в лимит (20 июля)

Полный разбор →

Alibaba выпустила Qwen-Audio-3.0-TTS — новую модель синтеза речи с поддержкой русского языка

Alibaba представила Qwen-Audio-3.0-TTSi — модель синтеза речи в двух версиях: Flash (для голосовых интерфейсов в реальном времени) и Plus (для генерации с упором на естественность и точную передачу тембра). Модель поддерживает 16 языков, включая русский, умеет клонировать голос по образцу и заняла 1-е место в рейтинге Artificial Analysis TTS Leaderboardi (версия Plus).

Голосом можно управлять как обычными текстовыми инструкциями («читай медленно», «как сказку перед сном», «голосом ведущей утреннего радио»), так и с помощью 86 встроенных тегов эмоций и звуков — например [angry], [whispers], [laughing], [sighing], [breaths]. Модель пока не выложена в open source, доступ продаётся через Alibaba Cloud.

16поддерживаемых языков
86тегов эмоций и звуков
3 минутымаксимум аудио за один проход

Полный разбор →

Внедрение AI в корпоративную культуру: управление изменениями и мышление

D@technohumanistAI-инженер
1 мес

Автоматизация заказов в условиях нестабильной инфраструктуры

К@ai_konstantinAI-инженер
1 мес

Hyper Research: новый скилл для Claude Code

C@cyberyozh_officialAI-инженер
1 мес

Дайджест новостей ИИ: OpenAI Health, FLUX 3, обновления Claude и статистика Google

1 мес

OpenAI добавила голосовой режим GPT-Live в десктопный ChatGPT с управлением агентами

OpenAI выпустила потоковый голосовой режим GPT-Live для десктопного приложения ChatGPT на Windows и macOS. Теперь пользователь может голосом запускать, проверять и направлять сразу несколько агентов — Codex и ChatGPT Work — не отрываясь от разговора, пока они выполняют задачи в фоне.

Обновление раскатывается глобально уже сейчас и доступно на платных тарифах Plus, Pro, Business, Edu и Enterprise; на бесплатном тарифе голос не включили. Почти одновременно улучшенный голосовой режим получил и Claude — на компьютерах, смартфонах и в браузере, с поддержкой моделей Opus и Sonnet и подключённых инструментов, однако управлять голосом Claude Code пока нельзя.

Self Gradient Forcing: стратегия обучения видеомоделей

Н@GreenNeuralRobotsAI-инженер
1 мес
Self Gradient Forcing Двухпроходная стратегия обучения для видеомоделей. Работает с градиентами, чтобы точнее попадать в нужные детали. Сравнение с Self-Forcing и другими методами см на сайте Гитхаб HF #optimization

Опыт использования Grok 4.5 и оптимизация лимитов AI-агентов

A@ai_drivenAI-инженер
1 мес

Приложение Language Model Builder учит создавать LLM с нуля на Mac

Разработчик выпустил приложение для macOS под названием Language Model Builderi, которое позволяет любому человеку с нуля пройти весь путь создания языковой модели — от теории до работающего нейропомощника. Инструмент бесплатный и сочетает интерактивный учебник с практическим тренингом собственной GPT-модели на своих данных.

Значимость — в доступности: раньше обучение LLMi требовало глубоких знаний ML, а теперь базовый процесс можно освоить за пару часов на обычном ноутбуке, получив на выходе рабочую модель уровня GPT-2-smalli, с которой можно общаться.

1.5 часадлительность интерактивного курса

Полный разбор →

Ещё ↓