DrivingBench: GPT-6 Astra провела настоящую Toyota Corolla через трассу из конусов, Claude и Grok сошли
Бенчмарк DrivingBench посадил языковые модели за руль настоящей Toyota Corolla и попросил проехать трассу из конусов. До финиша доехала только GPT-6 Astra, со второй попытки, остальные не прошли и половины пути.

21 сентября в 21:59 по Москве трое исследователей, Адитья Рамабадран, Саймон Манс и Тобиас Гесслер, представили DrivingBench. Вопрос у проекта простой: может ли универсальная языковая модель вести настоящий автомобиль? Моделям дали руль, газ и тормоз Toyota Corolla 2022 года. Задача — проехать около 130 метров между конусами на пустой парковке в районе залива Сан-Франциско и встать на «парковочное место» из синих конусов. Целиком трассу прошла одна модель из четырёх.
Как устроен заезд
- Машиной управляют через устройство comma four и открытый автопилот openpilot, подключённые к шине автомобиля. Модель получает кадры с камер, а также скорость машины и положение руля.
- Инструментов три: осмотреться, задать движение (направление, поворот руля в процентах, скорость, длительность) и экстренно затормозить.
- Скорость ограничена 3,5 м/с, это около 12,6 км/ч. Если машина разгонится выше 6 м/с, система отключается сама.
- За рулём сидит человек, нога над тормозом. Он тормозит, если машина выезжает за границы или вот-вот заденет препятствие.
- В зачёт идёт путь вдоль осевой линии трассы, пока машина держится не дальше 4 метров от неё.
- До трёх попыток в одном чате. Между попытками модель разбирает свои ошибки и едет снова с этим опытом.
- Каждая модель работала в своей штатной среде: GPT — в Codex, Claude — в Claude Code, Grok — в Cursor. Уровень рассуждений у всех средний.
Кто доехал
| Модель | Итог | Попытки по порядку |
|---|---|---|
| GPT-6 Astra | 100%, 134,7 м за 5:22 | 49% → 100%, третья не нужна |
| Claude Fable 5.1 | 45% | 9% → 10% → 45% |
| Grok 4.6 | 11% | 8% → 11% → 10% |
| GPT-5.6 Sol | 6% | 6% → 6% → 6% |
Победный заезд Astra обошёлся в 6,6 млн токенов и $7,74 по прейскуранту. За пять с небольшим минут модель отдала 24 команды.
Почему машины съезжали с трассы
Большинство попыток закончилось на первом повороте. Подвело зрение: модели не понимали, с какой стороны от диагональной линии конусов идёт полоса. Одна решила, что цвет конуса подсказывает сторону, хотя в задании прямо написано, что конусы разноцветные. Другая не учла, что машина шире, чем кажется на камере.
Вторая беда — раздумья. Машина едет, пока модель думает. Astra смотрела на дорогу каждые 5–6 секунд и давала около шести команд в минуту. Claude Fable во второй попытке ехала 31 секунду из 190. Всё остальное время она думала, стоя на тормозе.
И третье — обучение по ходу. После первой попытки Astra сама записала, что поторопилась с выравниванием. Во второй она ни разу не разогналась выше 0,8 м/с и доехала. Fable начала с резких поворотов руля, поняла, что перебарщивает, и перешла на 30%. Третья попытка у неё вышла самой длинной.
Авторы честно перечисляют ограничения. Каждую модель прогнали один раз. Камера не видит бордюр под самой машиной и то, что сбоку. Подсказка о повороте руля в задании была слишком осторожной. Изданию The Register Рамабадран сказал, что водить машину такими моделями пока непрактично. Удивляет другое: универсальная модель вообще проехала настоящую трассу.
Что это значит для бизнеса
Вывод DrivingBench шире автомобилей. Четыре модели из громких релизов этого года получили одинаковую задачу. Одна доехала до финиша, две не миновали первый поворот. Имя и рейтинги ничего не гарантируют на вашей задаче. Проверять ИИ нужно на своих данных и в своих условиях, до того как доверить ему работу.
Что взять из эксперимента себе:
- Своя трасса. Соберите 20–30 настоящих случаев: типовые запросы, редкие исключения, ошибки прошлого месяца. Прогоните ИИ по ним до запуска.
- Больше одного прогона. Один удачный заезд может оказаться случайностью. Для решения о внедрении нужна серия.
- Нога над тормозом. В тесте человек мог остановить машину в любую секунду. В компании так же: ИИ делает работу, человек принимает результат, пока не накопится статистика.
- Скорость реакции. Машина ехала, пока модель думала. У телефонного разговора та же физика: долгая пауза, и клиент уже сомневается.
- Разбор ошибок. Сильнее всех выросли модели, которые разбирали свои промахи. Журнал ошибок полезен и людям, и программам.
Цену и сроки собственного ИИ-агента мы считали в статье про разработку ИИ-агента. А кто отвечает, когда агент ошибся, — в новости о позиции FTC.
На том же правиле держится IT-специалист КАРАДЕСК — собственный IT-специалист компании в аренду для программ и сервисов, в том числе интеграций с CRM и 1С. Каждое изменение проходит тесты, повторную проверку и ревью инженером, а выкладка идёт только после одобрения клиента. Архитектуру утверждает инженер. Цель и приёмка остаются за клиентом, код и документация тоже.
Коротко
- 21 сентября авторы DrivingBench показали, как языковые модели водят настоящую Toyota Corolla по трассе из конусов длиной около 130 метров.
- Финишировала только GPT-6 Astra: со второй попытки, 134,7 м за 5 минут 22 секунды.
- Claude Fable 5.1 проехала 45% трассы, Grok 4.6 — 11%, GPT-5.6 Sol — 6%.
- Чаще всего модели ошибались в зрении и теряли время на раздумья, пока машина ехала.
- Для бизнеса вывод простой: проверять ИИ на своих задачах и оставлять приёмку за человеком.
Вопросы и ответы
Что такое DrivingBench?
Открытый тест, в котором языковые модели управляют настоящей Toyota Corolla через устройство comma four и openpilot. Модель видит кадры с камер, задаёт поворот руля, скорость и длительность движения, а человек за рулём страхует тормозом.
Какая модель справилась в DrivingBench?
GPT-6 Astra — единственная, кто проехал трассу целиком: со второй попытки, за 5 минут 22 секунды. Claude Fable 5.1 добралась до 45% пути, Grok 4.6 и GPT-5.6 Sol не прошли первый поворот.
Значит ли это, что ИИ скоро заменит водителей?
Нет. Скорость была ограничена примерно 12,6 км/ч, за рулём сидел человек, а каждую модель проверили один раз. Сами авторы называют такое вождение пока непрактичным.
Продукт: IT-специалист
Обсудим вашу задачу
Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.







