Хотя передовая ИИ-модель Gemini 4 Argon в стандартных тестах обошла GPT-6 Astra от OpenAI, даже внутри компании Google сомневаются в валидности этих результатов.
Сотрудники корпорации сомневаются в практической пользе новинки, заявляя о проблемах с написанием кода на практике, пишет Android Headlines со ссылкой на Bloomberg.
По информации инсайдеров, Gemini 4 Argon отлично решает синтетические задания, но спотыкается на практических задачах по веб-разработке и написанию сложного софта.
В отрасли такой феномен называют термином "benchmaxxing" — когда алгоритмы целенаправленно натаскивают на прохождение тестов в ущерб реальным навыкам.
Читать на focus.ua