Бенчмарк сборки мебели IKEA от Epoch AI: ИИ находит ошибки по фото в 80% случаев против 28% в 2025
Epoch AI выпустила бенчмарк сборки мебели IKEA: модели ищут ошибку сборщика на фото по инструкции. Лидер дал 80% верных ответов, хотя в ноябре 2025 года лидер набирал 28%.

Шкаф собран, дверца висит чуть криво, а винт на третьем шаге стоит не той стороной. Заметит ли это ИИ по одной фотографии? Исследовательская организация Epoch AI проверила именно это и 23 сентября опубликовала отчёт о новом тесте — Furniture Assembly Benchmark, или FAB. Авторы — Эйден Амент и Грег Бёрнем. Главная цифра: модель-лидер правильно нашла ошибку в 80% заданий. В ноябре 2025 года рекорд был 28%.
Что именно проверяли
Исследователи сами собирали три изделия IKEA: обувницу STÄLL, каркас кровати TONSTAD и комод GULLABERG. По ходу сборки они намеренно ошибались — и собирали дальше, будто ничего не случилось. Так ошибку труднее найти: она уже закрыта следующими деталями.
Модель получала фото недособранной мебели и техническую инструкцию. Задача — сказать, на каком шаге ошибка и в чём она. Всего 60 снимков.
| Модель | Верных ответов |
|---|---|
| GPT-6 Astra | 80% |
| Claude Fable 5.1 | 70% |
| Claude Opus 5 | 61% |
| Claude Opus 4.5, лидер ноября 2025 | 28% |
Что ещё есть в отчёте:
- Скорость. GPT-6 Astra тратила в среднем (по медиане) около трёх минут на задание. По оценке авторов, это в два–десять раз быстрее прежних лидеров.
- Как ставили оценку. Сначала проверяли, верно ли модель назвала шаги с ошибкой. Потом описание ошибки сверял отдельный ИИ-проверяющий.
- Китайские открытые модели. Сильнейшая из них, Kimi K3, на момент выхода отставала от лидеров на семь месяцев. По общим способностям разрыв меньше — 4,4 месяца.
- Человека не мерили. Сколько ошибок нашёл бы обычный сборщик, авторы пока не знают.
Оговорка важная. Шестьдесят фото трёх изделий — маленькая выборка. Авторы прямо пишут, что неясно, насколько результат переносится на другие физические задачи. Но вывод они делают осторожно-смелый: у моделей появились навыки пространственного мышления, полезные для обслуживания техники и поиска механических неисправностей.
Что это значит для бизнеса: проверка работы по фото
В ноябре 2025 года такую проверку ИИ проваливал в семи случаях из десяти. Теперь модель-лидер проваливает её в двух из десяти. Для компаний, где работу принимают по фотографии, это уже рабочая возможность рынка, а не лабораторный фокус.
Где это пригодится:
- Приёмка монтажа и сборки. Мебельщики, установщики окон, кухонь, кондиционеров. Мастер присылает фото, и объект закрывают. Кривой крепёж всплывает через месяц — жалобой клиента и бесплатным выездом.
- Фотоотчёты сервисных бригад. Прораб физически не успевает пересмотреть 40 снимков за вечер. Смотрит три, остальные пролистывает. Первичный разбор по инструкции снимает эту нагрузку и оставляет человеку спорные случаи.
- Брак на производстве. Сборочный участок, упаковка, комплектность. Фото уже делают — осталось сверять его с техкартой.
Честно говоря, до замены приёмщика далеко. Каждое пятое задание лидер всё ещё решает неверно, а тест шёл на трёх изделиях. Разумная схема сегодня — ИИ помечает подозрительные снимки, окончательное решение за человеком.
Готовой проверки фото в продуктах КАРАДЕСК нет. Такую систему под свои техкарты компания может заказать IT-специалисту КАРАДЕСК: он делает прикладные программы, IT-сервисы, интеграции с CRM и 1С и системы аналитики, задачи ставятся голосом, текстом или брифом, а код и документация остаются у клиента. Сам принцип — проверять каждый случай по одинаковым критериям — КАРАДЕСК уже применяет к разговорам: Аналитика продаж разбирает каждый звонок по одинаковым критериям, и вывод связан с фрагментом разговора. Как устроен такой разбор, мы рассказывали в статье «Речевая аналитика», а как заказать своего агента под задачу — в статье «Разработка ИИ-агента».
Коротко
- Epoch AI 23 сентября выпустила бенчмарк FAB: модели ищут ошибки сборки мебели IKEA по фото и инструкции.
- Рекорд — 80% у GPT-6 Astra; в ноябре 2025 года лидер набирал 28%.
- Выборка маленькая: 60 фото трёх изделий, результат людей не измеряли.
- Для бизнеса это возможность первичной проверки фотоотчётов монтажа, сервиса и сборки — решение остаётся за человеком.
Вопросы и ответы
Что такое Furniture Assembly Benchmark от Epoch AI?
Тест, в котором ИИ по фото недособранной мебели IKEA и инструкции ищет шаг с ошибкой и описывает её. В нём 60 снимков сборки обувницы STÄLL, кровати TONSTAD и комода GULLABERG.
Какая модель точнее всех находит ошибки сборки?
GPT-6 Astra — 80% верных ответов. Claude Fable 5.1 набрала 70%, Claude Opus 5 — 61%. Рекорд ноября 2025 года был 28%.
Можно ли уже доверить ИИ приёмку монтажа по фото?
Только как первичный фильтр. Даже модель-лидер ошибается в каждом пятом задании, а тест охватывал три изделия. Спорные и помеченные снимки должен смотреть человек.
Насколько отстают китайские открытые модели?
По оценке Epoch AI, сильнейшая из них, Kimi K3, отставала от лидеров на семь месяцев на момент выхода. По общим способностям разрыв — 4,4 месяца.
Продукт: IT-специалист
Обсудим вашу задачу
Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.







