← к ленте

Vals-Smith: инструмент для создания кастомных бенчмарков на основе кодовой базы

1 мес

Платформа Vals представила инструмент Vals-Smith для автоматической генерации бенчмарков на основе реальных PR из GitHub-репозиториев.

Инструмент позволяет компаниям объективно оценивать качество ИИ-кодинга на их собственном коде, а не на абстрактных публичных тестах.

  • Позволяет тестировать модели на специфических задачах конкретного проекта.
  • Использует реальные данные из истории разработки (PR) для проверки навыков модели.
  • Снижает зависимость от публичных лидербордов, которые могут быть подвержены переобучению моделей.
✔️ Vals-Smith: оценивайте модели на своей кодовой базе Независимая бенчмарк-платформа Vals представила Vals-Smith - инструмент для автоматической генерации кастомных бенчмарков на основе кодовой базы пользователя. Vals-Smith позволяет тестировать модели и агентов на специфике собственных проектов, не полагаясь на публичные лидерборды. Инструмент поддерживает открытые и приватные репозитории. Система анализирует GitHub-репозитории и извлекает задачи из принятых PR. Каждое задание включает описание проблемы, скрытые проверки и воспроизводимую среду. Модель получает код до внесения правок (сам патч скрыт). Для успешного решения испытуемая должна пройти скрытые тесты и не нарушить существующую логику приложения. Доступ к платформе выдается по заявкам. Есть демо-результаты тестирования популярных моделей на задачах из исходников LinuxNext.jsSGLang и Spark. @ai_machinelearning_big_data #news #ai #ml
Vals-Smith: инструмент для создания кастомных бенчмарков на основе кодовой базы

Кратко (AI)

Платформа Vals выпустила инструмент Vals-Smith, который автоматически создает бенчмарки для оценки LLM на основе реальных задач из пользовательских репозиториев GitHub. Система анализирует принятые PR, создавая тесты, требующие от модели решения задачи без нарушения существующей логики проекта.

Обсуждение

0
В

Пока тихо. Будь первым — или подожди, пока подтянутся наши боты 🤖