Бенчмарк сборки мебели IKEA от Epoch AI: ИИ находит ошибки по фото в 80% случаев против 28% в 2025

Новости ИИ · · Источник: отчёт исследовательской организации Epoch AI «Furniture Assembly Benchmark» · Редакция КАРАДЕСК

Epoch AI выпустила бенчмарк сборки мебели IKEA: модели ищут ошибку сборщика на фото по инструкции. Лидер дал 80% верных ответов, хотя в ноябре 2025 года лидер набирал 28%.

Обложка новости — Epoch AI: ИИ ищет ошибки сборки IKEA. Модель-лидер права в 80% заданий, в ноябре 2025 — 28%. Объёмный знак КАРАДЕСК и значок темы «модель»

Шкаф собран, дверца висит чуть криво, а винт на третьем шаге стоит не той стороной. Заметит ли это ИИ по одной фотографии? Исследовательская организация Epoch AI проверила именно это и 23 сентября опубликовала отчёт о новом тесте — Furniture Assembly Benchmark, или FAB. Авторы — Эйден Амент и Грег Бёрнем. Главная цифра: модель-лидер правильно нашла ошибку в 80% заданий. В ноябре 2025 года рекорд был 28%.

Что именно проверяли

Исследователи сами собирали три изделия IKEA: обувницу STÄLL, каркас кровати TONSTAD и комод GULLABERG. По ходу сборки они намеренно ошибались — и собирали дальше, будто ничего не случилось. Так ошибку труднее найти: она уже закрыта следующими деталями.

Модель получала фото недособранной мебели и техническую инструкцию. Задача — сказать, на каком шаге ошибка и в чём она. Всего 60 снимков.

МодельВерных ответов
GPT-6 Astra80%
Claude Fable 5.170%
Claude Opus 561%
Claude Opus 4.5, лидер ноября 202528%

Что ещё есть в отчёте:

  • Скорость. GPT-6 Astra тратила в среднем (по медиане) около трёх минут на задание. По оценке авторов, это в два–десять раз быстрее прежних лидеров.
  • Как ставили оценку. Сначала проверяли, верно ли модель назвала шаги с ошибкой. Потом описание ошибки сверял отдельный ИИ-проверяющий.
  • Китайские открытые модели. Сильнейшая из них, Kimi K3, на момент выхода отставала от лидеров на семь месяцев. По общим способностям разрыв меньше — 4,4 месяца.
  • Человека не мерили. Сколько ошибок нашёл бы обычный сборщик, авторы пока не знают.

Оговорка важная. Шестьдесят фото трёх изделий — маленькая выборка. Авторы прямо пишут, что неясно, насколько результат переносится на другие физические задачи. Но вывод они делают осторожно-смелый: у моделей появились навыки пространственного мышления, полезные для обслуживания техники и поиска механических неисправностей.

Что это значит для бизнеса: проверка работы по фото

В ноябре 2025 года такую проверку ИИ проваливал в семи случаях из десяти. Теперь модель-лидер проваливает её в двух из десяти. Для компаний, где работу принимают по фотографии, это уже рабочая возможность рынка, а не лабораторный фокус.

Где это пригодится:

  1. Приёмка монтажа и сборки. Мебельщики, установщики окон, кухонь, кондиционеров. Мастер присылает фото, и объект закрывают. Кривой крепёж всплывает через месяц — жалобой клиента и бесплатным выездом.
  2. Фотоотчёты сервисных бригад. Прораб физически не успевает пересмотреть 40 снимков за вечер. Смотрит три, остальные пролистывает. Первичный разбор по инструкции снимает эту нагрузку и оставляет человеку спорные случаи.
  3. Брак на производстве. Сборочный участок, упаковка, комплектность. Фото уже делают — осталось сверять его с техкартой.

Честно говоря, до замены приёмщика далеко. Каждое пятое задание лидер всё ещё решает неверно, а тест шёл на трёх изделиях. Разумная схема сегодня — ИИ помечает подозрительные снимки, окончательное решение за человеком.

Готовой проверки фото в продуктах КАРАДЕСК нет. Такую систему под свои техкарты компания может заказать IT-специалисту КАРАДЕСК: он делает прикладные программы, IT-сервисы, интеграции с CRM и 1С и системы аналитики, задачи ставятся голосом, текстом или брифом, а код и документация остаются у клиента. Сам принцип — проверять каждый случай по одинаковым критериям — КАРАДЕСК уже применяет к разговорам: Аналитика продаж разбирает каждый звонок по одинаковым критериям, и вывод связан с фрагментом разговора. Как устроен такой разбор, мы рассказывали в статье «Речевая аналитика», а как заказать своего агента под задачу — в статье «Разработка ИИ-агента».

Коротко

  • Epoch AI 23 сентября выпустила бенчмарк FAB: модели ищут ошибки сборки мебели IKEA по фото и инструкции.
  • Рекорд — 80% у GPT-6 Astra; в ноябре 2025 года лидер набирал 28%.
  • Выборка маленькая: 60 фото трёх изделий, результат людей не измеряли.
  • Для бизнеса это возможность первичной проверки фотоотчётов монтажа, сервиса и сборки — решение остаётся за человеком.

Вопросы и ответы

Что такое Furniture Assembly Benchmark от Epoch AI?

Тест, в котором ИИ по фото недособранной мебели IKEA и инструкции ищет шаг с ошибкой и описывает её. В нём 60 снимков сборки обувницы STÄLL, кровати TONSTAD и комода GULLABERG.

Какая модель точнее всех находит ошибки сборки?

GPT-6 Astra — 80% верных ответов. Claude Fable 5.1 набрала 70%, Claude Opus 5 — 61%. Рекорд ноября 2025 года был 28%.

Можно ли уже доверить ИИ приёмку монтажа по фото?

Только как первичный фильтр. Даже модель-лидер ошибается в каждом пятом задании, а тест охватывал три изделия. Спорные и помеченные снимки должен смотреть человек.

Насколько отстают китайские открытые модели?

По оценке Epoch AI, сильнейшая из них, Kimi K3, отставала от лидеров на семь месяцев на момент выхода. По общим способностям разрыв — 4,4 месяца.

Продукт: IT-специалист

Обсудим вашу задачу

Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.

Подробнее о продукте «IT-специалист»

Заявка принята

Перезвоним в рабочее время. Спасибо, что дочитали!

Свежие новости ИИ

Обложка новости — Alibaba: Qwen-Audio-3.1. Пять речевых моделей, цены ниже до 95%. Объёмный знак КАРАДЕСК и значок темы «звук»28 сентября 2026, 04:17 МСК · Alibaba выпустила Qwen-Audio-3.1: пять речевых моделей и скидки до 95% на распознавание и синтез речи — Alibaba выпустила Qwen-Audio-3.1 — пять моделей для распознавания речи, синтеза голоса и разговора в реальном времени — и объявила скидки до 95%. Голосовой ИИ дешевеет быстрее, чем компании успевают его внедрять.Обложка новости — Билл Гейтс: Гейтс: кнопки отключения мало. ИИ нужны наблюдение и записи того, что он делает. Объёмный знак КАРАДЕСК и значок темы «закон»28 сентября 2026, 02:53 МСК · Билл Гейтс: kill switch для ИИ мало, а договориться об ИИ сложнее, чем о ядерном оружии — Билл Гейтс считает, что kill switch, то есть «кнопки отключения» для ИИ, недостаточно: без наблюдения и записей того, что делает система, остановить плохое поведение нечем. В полном интервью Meet the Press он также назвал глобальное соглашение об ИИ задачей сложнее переговоров о ядерном оружии.Обложка новости — OpenAI: Codex CLI 0.157. ИИ-агент для кода работает в фоне, очередь задач сохраняется. Объёмный знак КАРАДЕСК и значок темы «код»28 сентября 2026, 02:13 МСК · Codex CLI 0.157: OpenAI включила фоновый сервер по умолчанию — агент для кода работает в фоне — OpenAI выпустила Codex CLI 0.157: фоновый сервер теперь запускается сам в подходящих интерактивных сессиях, а разговор с агентом можно подхватить из другого приложения вместе с черновиком и очередью запросов. Агент для кода всё меньше похож на чат и всё больше — на сотрудника с собственным списком задач.Обложка новости — Минцифры: Верификация Android и Россия. Минцифры ищет, как защитить российские приложения. Объёмный знак КАРАДЕСК и значок темы «код»28 сентября 2026, 01:33 МСК · Шадаев о верификации разработчиков Google для Android: Минцифры оценивает риски для российских приложений — Минцифры оценивает, чем верификация разработчиков Android обернётся для российских приложений: с 2027 года Google собирается ставить на сертифицированные устройства только программы подтверждённых авторов. Министерство вместе с отраслью готовит предложения, как снизить риски.Обложка новости — Anthropic: Claude нашёл систему ART. 950 агентов за 21 час нашли в ДНК фагов аналог CRISPR. Объёмный знак КАРАДЕСК и значок темы «агент»28 сентября 2026, 00:53 МСК · Claude нашёл новую ферментную систему ART, похожую на CRISPR: 950 ИИ-агентов, 21 час и 210 млн токенов — Anthropic сообщила, что Claude нашёл ранее не описанную ферментную систему в ДНК бактериофагов: рядом с геном фермента лежит длинный ряд повторов, похожий на CRISPR. Поиск вели около 950 агентов за 21 час.Обложка новости — Берни Сандерс: Запрет сверхинтеллекта. Пауза в разработке мощного ИИ и министерство ИИ в США. Объёмный знак КАРАДЕСК и значок темы «закон»28 сентября 2026, 00:13 МСК · Берни Сандерс внёс закон о запрете сверхинтеллекта: пауза в разработке ИИ и министерство ИИ в США — Сенатор Берни Сандерс и конгрессмен Грег Касар предложили закон о запрете ИИ-сверхинтеллекта: разработку самых мощных моделей в США поставят на паузу, пока новое министерство ИИ не напишет правила. Шансы на принятие малы, но сам проект показывает, куда движется спор о контроле над ИИ.

Читайте в статьях

Обложка статьи — Свой ИИ-агент. Заказать разработку или взять готового — считаем и сравниваем. Плашка «IT-специалист», объёмный знак КАРАДЕСК и значок темы «код»Разработка и интеграции · 20 мин · Разработка ИИ-агента: цена, сроки и когда выгоднее взять готового ИИ-сотрудника — Разработка ИИ-агента имеет смысл там, где процесс у вас свой и готового решения под него нет. Для типовой работы — звонков, записи клиентов — обычно быстрее и дешевле взять готового ИИ-сотрудника. Ниже — как понять, какой у вас случай, из чего складывается цена, что спросить исполнителя и как не получить агента, которым командует любое входящее письмо.Обложка статьи — ИИ-программист. что делает и где нужен человек. Плашка «IT-специалист», объёмный знак КАРАДЕСК и значок темы «код»Разработка и интеграции · 8 мин · ИИ-программист: что он делает и где нужен человек — ИИ-программист берёт большую часть разработки: пишет код, тесты и документацию, разбирается в чужих программах и готовит выкладку. Цель, приёмка и согласие на выкладку остаются за вами, архитектуру утверждает инженер. Разберём, что он умеет, чем отличается от нейросети в чате и фрилансера и сколько стоит альтернатива.