DrivingBench: GPT-6 Astra провела настоящую Toyota Corolla через трассу из конусов, Claude и Grok сошли

Новости ИИ · · Источник: сайт и отчёт проекта DrivingBench, анонс в аккаунте проекта в X · Редакция КАРАДЕСК

Бенчмарк DrivingBench посадил языковые модели за руль настоящей Toyota Corolla и попросил проехать трассу из конусов. До финиша доехала только GPT-6 Astra, со второй попытки, остальные не прошли и половины пути.

Обложка новости — DrivingBench: ИИ за рулём Toyota Corolla. Трассу из конусов прошла одна модель из четырёх. Объёмный знак КАРАДЕСК и значок темы «модель»

21 сентября в 21:59 по Москве трое исследователей, Адитья Рамабадран, Саймон Манс и Тобиас Гесслер, представили DrivingBench. Вопрос у проекта простой: может ли универсальная языковая модель вести настоящий автомобиль? Моделям дали руль, газ и тормоз Toyota Corolla 2022 года. Задача — проехать около 130 метров между конусами на пустой парковке в районе залива Сан-Франциско и встать на «парковочное место» из синих конусов. Целиком трассу прошла одна модель из четырёх.

Как устроен заезд

  • Машиной управляют через устройство comma four и открытый автопилот openpilot, подключённые к шине автомобиля. Модель получает кадры с камер, а также скорость машины и положение руля.
  • Инструментов три: осмотреться, задать движение (направление, поворот руля в процентах, скорость, длительность) и экстренно затормозить.
  • Скорость ограничена 3,5 м/с, это около 12,6 км/ч. Если машина разгонится выше 6 м/с, система отключается сама.
  • За рулём сидит человек, нога над тормозом. Он тормозит, если машина выезжает за границы или вот-вот заденет препятствие.
  • В зачёт идёт путь вдоль осевой линии трассы, пока машина держится не дальше 4 метров от неё.
  • До трёх попыток в одном чате. Между попытками модель разбирает свои ошибки и едет снова с этим опытом.
  • Каждая модель работала в своей штатной среде: GPT — в Codex, Claude — в Claude Code, Grok — в Cursor. Уровень рассуждений у всех средний.

Кто доехал

МодельИтогПопытки по порядку
GPT-6 Astra100%, 134,7 м за 5:2249% → 100%, третья не нужна
Claude Fable 5.145%9% → 10% → 45%
Grok 4.611%8% → 11% → 10%
GPT-5.6 Sol6%6% → 6% → 6%

Победный заезд Astra обошёлся в 6,6 млн токенов и $7,74 по прейскуранту. За пять с небольшим минут модель отдала 24 команды.

Почему машины съезжали с трассы

Большинство попыток закончилось на первом повороте. Подвело зрение: модели не понимали, с какой стороны от диагональной линии конусов идёт полоса. Одна решила, что цвет конуса подсказывает сторону, хотя в задании прямо написано, что конусы разноцветные. Другая не учла, что машина шире, чем кажется на камере.

Вторая беда — раздумья. Машина едет, пока модель думает. Astra смотрела на дорогу каждые 5–6 секунд и давала около шести команд в минуту. Claude Fable во второй попытке ехала 31 секунду из 190. Всё остальное время она думала, стоя на тормозе.

И третье — обучение по ходу. После первой попытки Astra сама записала, что поторопилась с выравниванием. Во второй она ни разу не разогналась выше 0,8 м/с и доехала. Fable начала с резких поворотов руля, поняла, что перебарщивает, и перешла на 30%. Третья попытка у неё вышла самой длинной.

Авторы честно перечисляют ограничения. Каждую модель прогнали один раз. Камера не видит бордюр под самой машиной и то, что сбоку. Подсказка о повороте руля в задании была слишком осторожной. Изданию The Register Рамабадран сказал, что водить машину такими моделями пока непрактично. Удивляет другое: универсальная модель вообще проехала настоящую трассу.

Что это значит для бизнеса

Вывод DrivingBench шире автомобилей. Четыре модели из громких релизов этого года получили одинаковую задачу. Одна доехала до финиша, две не миновали первый поворот. Имя и рейтинги ничего не гарантируют на вашей задаче. Проверять ИИ нужно на своих данных и в своих условиях, до того как доверить ему работу.

Что взять из эксперимента себе:

  1. Своя трасса. Соберите 20–30 настоящих случаев: типовые запросы, редкие исключения, ошибки прошлого месяца. Прогоните ИИ по ним до запуска.
  2. Больше одного прогона. Один удачный заезд может оказаться случайностью. Для решения о внедрении нужна серия.
  3. Нога над тормозом. В тесте человек мог остановить машину в любую секунду. В компании так же: ИИ делает работу, человек принимает результат, пока не накопится статистика.
  4. Скорость реакции. Машина ехала, пока модель думала. У телефонного разговора та же физика: долгая пауза, и клиент уже сомневается.
  5. Разбор ошибок. Сильнее всех выросли модели, которые разбирали свои промахи. Журнал ошибок полезен и людям, и программам.

Цену и сроки собственного ИИ-агента мы считали в статье про разработку ИИ-агента. А кто отвечает, когда агент ошибся, — в новости о позиции FTC.

На том же правиле держится IT-специалист КАРАДЕСК — собственный IT-специалист компании в аренду для программ и сервисов, в том числе интеграций с CRM и 1С. Каждое изменение проходит тесты, повторную проверку и ревью инженером, а выкладка идёт только после одобрения клиента. Архитектуру утверждает инженер. Цель и приёмка остаются за клиентом, код и документация тоже.

Коротко

  • 21 сентября авторы DrivingBench показали, как языковые модели водят настоящую Toyota Corolla по трассе из конусов длиной около 130 метров.
  • Финишировала только GPT-6 Astra: со второй попытки, 134,7 м за 5 минут 22 секунды.
  • Claude Fable 5.1 проехала 45% трассы, Grok 4.6 — 11%, GPT-5.6 Sol — 6%.
  • Чаще всего модели ошибались в зрении и теряли время на раздумья, пока машина ехала.
  • Для бизнеса вывод простой: проверять ИИ на своих задачах и оставлять приёмку за человеком.

Вопросы и ответы

Что такое DrivingBench?

Открытый тест, в котором языковые модели управляют настоящей Toyota Corolla через устройство comma four и openpilot. Модель видит кадры с камер, задаёт поворот руля, скорость и длительность движения, а человек за рулём страхует тормозом.

Какая модель справилась в DrivingBench?

GPT-6 Astra — единственная, кто проехал трассу целиком: со второй попытки, за 5 минут 22 секунды. Claude Fable 5.1 добралась до 45% пути, Grok 4.6 и GPT-5.6 Sol не прошли первый поворот.

Значит ли это, что ИИ скоро заменит водителей?

Нет. Скорость была ограничена примерно 12,6 км/ч, за рулём сидел человек, а каждую модель проверили один раз. Сами авторы называют такое вождение пока непрактичным.

Продукт: IT-специалист

Обсудим вашу задачу

Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.

Подробнее о продукте «IT-специалист»

Заявка принята

Перезвоним в рабочее время. Спасибо, что дочитали!

Свежие новости ИИ

Обложка новости — Sony: Sony зовёт 8 000 человек в офис. Чиповое подразделение ускоряет разработку физического ИИ. Объёмный знак КАРАДЕСК и значок темы «чип»27 сентября 2026, 06:33 МСК · Sony возвращает 8 000 сотрудников чипового подразделения в офис ради «физического ИИ» — Nikkei — Sony возвращает сотрудников в офис: чиповое подразделение Sony Semiconductor Solutions с октября переводит около 8 000 человек на работу в офисе как основное правило. Как сообщает Nikkei, цель — быстрее разрабатывать физический ИИ, то есть ИИ, который управляет роботами и машинами.Обложка новости — Google: Штраф Google 403 млн евро. Геоданные собирали и хранили без понятного согласия. Объёмный знак КАРАДЕСК и значок темы «закон»27 сентября 2026, 05:53 МСК · Google получила штраф 403 млн евро в Ирландии за сбор геоданных пользователей без их ведома — Штраф Google 403 млн евро назначила Комиссия по защите данных Ирландии: компания обрабатывала геоданные пользователей так, что люди могли не знать, что их перемещения идут на рекламу и выводы об интересах. Шесть месяцев на исправление — и хороший повод проверить, что и сколько хранит ваша компания.Обложка новости — IFR: 7 000 гуманоидов за 2025 год. Первый мировой подсчёт: роботов пока берут для данных. Объёмный знак КАРАДЕСК и значок темы «чип»27 сентября 2026, 05:33 МСК · Продажи гуманоидных роботов в 2025 году — около 7 000 штук: первый мировой подсчёт IFR — Продажи гуманоидных роботов в 2025 году составили около 7 000 штук по всему миру — это первый такой подсчёт Международной федерации робототехники (IFR). Цифра скромная на фоне громких демонстраций: значительную часть роботов купили лаборатории, чтобы собирать данные для обучения ИИ.Обложка новости — Anthropic: Claude Opus 5.5. Дешевле на 20%, быстрее на 30%, агенты осторожнее. Объёмный знак КАРАДЕСК и значок темы «модель»27 сентября 2026, 05:16 МСК · Anthropic выпустила Claude Opus 5.5: токены дешевле на 20%, агенты на 85% реже пытаются выйти за рамки — Anthropic выпустила Claude Opus 5.5: миллион токенов стоит на 20% дешевле, чем у Opus 5, а в тесте на выход за рамки модель пыталась обойти ограничения на 85% реже. Для компаний, которые доверяют ИИ-агентам реальную работу, важны обе цифры.Обложка новости — Яндекс: Alice AI Foundation. Модель Яндекса с нуля, открытые веса и 80 млрд параметров. Объёмный знак КАРАДЕСК и значок темы «модель»27 сентября 2026, 05:09 МСК · Яндекс выложил Alice AI Foundation: суверенная модель на 80 млрд параметров, обученная с нуля — Яндекс выложил в открытый доступ Alice AI Foundation — языковую модель на 80 млрд параметров, которую компания обучила с нуля, без весов чужих открытых моделей. На фоне закона о суверенных моделях ИИ это заявка на статус российской базы для корпоративных сервисов.Обложка новости — Билл Гейтс: Гейтс за закон об ИИ. Саморегулирования мало, нужен контроль государства. Объёмный знак КАРАДЕСК и значок темы «закон»27 сентября 2026, 05:03 МСК · Билл Гейтс призвал к государственному регулированию ИИ: «саморегулирования недостаточно» — Билл Гейтс выступил за государственное регулирование ИИ: по его словам, саморегулирования компаний не хватает, а федеральный закон в США нужен «безусловно». Спор о том, регулировать ли ИИ, всё больше сдвигается к вопросу, как именно.

Читайте в статьях

Обложка статьи — Свой ИИ-агент. Заказать разработку или взять готового — считаем и сравниваем. Плашка «IT-специалист», объёмный знак КАРАДЕСК и значок темы «код»Разработка и интеграции · 20 мин · Разработка ИИ-агента: цена, сроки и когда выгоднее взять готового ИИ-сотрудника — Разработка ИИ-агента имеет смысл там, где процесс у вас свой и готового решения под него нет. Для типовой работы — звонков, записи клиентов — обычно быстрее и дешевле взять готового ИИ-сотрудника. Ниже — как понять, какой у вас случай, из чего складывается цена, что спросить исполнителя и как не получить агента, которым командует любое входящее письмо.Обложка статьи — ИИ-программист. что делает и где нужен человек. Плашка «IT-специалист», объёмный знак КАРАДЕСК и значок темы «код»Разработка и интеграции · 8 мин · ИИ-программист: что он делает и где нужен человек — ИИ-программист берёт большую часть разработки: пишет код, тесты и документацию, разбирается в чужих программах и готовит выкладку. Цель, приёмка и согласие на выкладку остаются за вами, архитектуру утверждает инженер. Разберём, что он умеет, чем отличается от нейросети в чате и фрилансера и сколько стоит альтернатива.