Google представила вторую версию бенчмарка Android Bench, который призван оценить производительность ИИ-моделей в разработке под Android. Компания сообщила, что новое тестирование стало точнее и больше фокусируется на сложных задачах, на которые у человека уходит несколько дней.
Главное отличие обновлённого бенчмарка — более детальная оценка решения задачи (Pass Rate). Теперь система оценивает ИИ-модель по нескольким категориям вроде функциональности сделанного ПО и может посчитать задачу частично решённой, даже если нейросеть не справилась с ней полностью. Раньше оценка была бинарной — модель её либо решала полностью, либо не получала очки за выполнение вовсе.
Компания также продемонстрировала, как актуальные модели показали себя в обновлённом бенчмарке. Лидером стала GPT-6 Astra с показателем Pass Rate в 28%. Следом за ней идут Claude Fable 5.1 и GPT-5.6 Sol.
Ознакомиться с актуальным рейтингом нейросетей в Android Bench 2 можно на официальном сайте.
