Перейти к содержимому
Опубликовано

Проблемы в оценке навыков программирования у ИИ

Автор
  • Имя
    Новости AI и AI разработки | GPT, Chat GPT, Claude, Cursor, Codex
    Telegram

Кратко

Проблемы в оценке навыков программирования у ИИКомпания OpenAI отозвала свои рекомендации по использованию SWE-Bench Pro — основного теста, по...

Проблемы в оценке навыков программирования у ИИ

Компания OpenAI отозвала свои рекомендации по использованию SWE-Bench Pro — основного теста, по которому индустрия оценивала качество написания кода нейросетями. Аудит показал, что около 30% заданий теста некорректны: они содержат противоречивые инструкции или невыполнимые требования.

Это означает, что недавние рекорды моделей в разработке софта могли быть завышены, и рынку требуются новые, более надежные критерии оценки эффективности инструментов автоматизации кодинга.

Ссылка: https://openai.com/index/separating-signal-from-noise-coding-evaluations/ @AIandproducts

Новости AI и AI разработки | GPT, Chat GPT, Claude, Cursor, Codex
193 подписчика
951 пост
Все о разработке с помощью AI От автора @productgames Кристины Гусевой Курс по вайбкодингу: https://pgcaseclub.com/vibecoding