← к ленте

Speko: единый API и роутер для голосовых AI-моделей

A@ai_productAI-инженер
1 нед

Обзор стартапа Speko, предлагающего единый API для 60+ голосовых моделей с автоматическим роутингом и бенчмарками для STT, LLM и TTS.

Упрощение интеграции голосового ИИ в продукты.

  • Единый API позволяет разработчикам переключаться между десятками моделей без переписывания кода.
  • Автоматический роутинг помогает балансировать между качеством, задержкой и стоимостью.
  • Открытые бенчмарки позволяют объективно сравнивать производительность разных провайдеров для конкретных задач.
Speko – OpenRouter для голосового AI Вчера попался интересный проект, который как-то хотел сделать сам :) Ребята из стартапа YCombinator сделали один API, за которым 60+ голосовых моделей, и роутер, который сам выбирает лучшую под язык и задачу. Что внутри: – 61 модель и 10 языков в бенчмарке; на платформе 16 STT, 16 LLM и 17 TTS. Русского в бенчмарках нет, есть европейские и индийские (сразу видно, откуда фаундеры), но можно самому потестить все модели (в списках есть все сотня языков) – говорите «оптимизируй под точность / задержку / цену», указываете язык и регион – роутер сам подбирает модель и в ответе честно пишет, кого позвал – 1 ключ, API совместим с OpenAI, из коробки заводится в LiveKit и Pipecat, есть TS, Python и MCP – тарифы: +5% к прайсу провайдера за роутинг либо $0.09/мин all-in за весь стек STT+LLM+TTS. На старте дают $100 кредитов, то есть можно обпробоваться по полной и потом если что уйти к исходным провайдерам – сам шлюз выложен в опенсорс под MIT – можно поднять у себя Но самое конечно интересное - поковыряться в бенчмарках :) https://benchmarks.speko.ai/ Пишут, что на 9 языках чтобы быть в топе надо использовать 4 разные модели (согласен с этим, аналогично было для перевода текстов у intento). Надергал вам скриншотов оттуда, куча данных для сравнения. Практически везде лучшие результаты не у популярных моделей, а у например qwen ASR или inworld, так что сравнивайте обязательно. Ещё пара фактов оттуда же: 95% продовых голосовых систем до сих пор каскадные (STT → LLM → TTS), а не end-to-end. Ну собственно поэтому они и делают сравнение 3 разных подсистем, а не end2end (за что им прилетело кстати на hackernews). Еще из прикольного - сравнение в реальном времени или на файлах. Вот например можете проверить всех провайдеров, которые заявляют русский - https://benchmarks.speko.ai/compare/stt?lang=ru&scenario=ru-support Советую! Будут крайне неожиданные результаты чаще всего :) Короче, очень понравился сайт. Прям кладезь инфы и тестов про голосовые модели. https://speko.ai
Speko: единый API и роутер для голосовых AI-моделей

Кратко (AI)

Стартап Speko представил единый API для работы с более чем 60 голосовыми моделями, включая STT, LLM и TTS. Сервис автоматически подбирает оптимальную модель под задачу и язык, поддерживает совместимость с OpenAI и предоставляет инструменты для бенчмаркинга различных провайдеров.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖