Project Swap: Anthropic отправила 201 ИИ-агента торговаться за людей — что вышло из эксперимента
Anthropic опубликовала итоги Project Swap — эксперимента, в котором ИИ-агенты на Claude сами торговались за 201 сотрудника компании. Агенты неплохо понимали вкусы людей и честно вели торг, но главным слабым местом оказалось именно понимание того, чего хочет человек.

Anthropic 24 сентября выложила в исследовательском блоге итоги эксперимента Project Swap. Летом 201 сотрудник из шести офисов принёс по книге, которую готов отдать, коротко рассказал ИИ-агенту о своих вкусах и отпустил его торговаться с агентами коллег. Агенту хватило пятиминутного разговора, чтобы угадать предпочтения человека в 61% пар книг. Случайный выбор дал бы 50%.
Это продолжение прошлого опыта компании, Project Deal, где агенты свободно покупали и продавали за сотрудников всякую всячину. Там было трудно понять, хорошо ли агент сыграл за своего человека. В Project Swap измерять проще: каждый участник заранее сам расставил по порядку 10 книг, и с этим списком сравнивали решения агента.
Что именно проверяли и как торговали агенты
Схема была простой. Человек переписывается с агентом о том, что любит читать. Агент по этому разговору ранжирует все книги своего офиса. Дальше агенты выходят на общую «торговую площадку» и договариваются.
| Параметр | По данным Anthropic |
|---|---|
| Участники | 201 сотрудник: Сан-Франциско — 115, Нью-Йорк — 57, Лондон — 12, Сиэтл — 8, Вашингтон — 6, Дублин — 3 |
| Модель в живом раунде | у всех агентов Opus 4.8 |
| Правила площадки | лимит времени, одновременно говорят лишь несколько агентов, одно сообщение за ход, вся история публична |
| Виды сделок | обмен один на один и обмен по кругу между несколькими участниками |
| Когда сделка проходит | только если согласились все её стороны |
| Установки агентам | половине — «жёсткая» (только выгода своего человека), половине — «с заботой об остальных» |
| Повторные прогоны | всего 205 запусков рынка, в том числе на Haiku 4.5, Sonnet 4.5 и Fable 5 |
Медианный участник написал агенту всего 216 слов в восьми сообщениях. Кто писал подробнее, тот получил более точного представителя: 300 слов вместо 150 давали примерно на 4 процентных пункта больше совпадений.
Главные выводы
- Слабое звено — понимание человека, торг идёт хорошо. В среднем люди получили книгу на уровне 0,55 по своей шкале, это примерно пятое место из десяти. Идеальное распределение дало бы 0,89, почти второе место. 85% недобора пришлось на неточное понимание вкусов и только 15% на сам хаотичный торг.
- Умнее модель — выгоднее сделки. Перевод агента с Haiku на Opus поднимал человека на 0,12 по его списку, с Sonnet на Opus — на 0,08. Особенно заметно это для самых обделённых: у худшей десятой части участников результат на площадках с Haiku был 0,05, а с Opus — 0,38.
- Жёсткость почти ничего не даёт. «Жёсткий» агент выигрывал у заботливого около 0,02. Заботливые вдвое чаще соглашались на книгу похуже, хотя оба случая редки.
- Агенты почти не врали. От 78% до 96% агентов в какой-то момент называли книгу-мечту своего человека, и лишь примерно один из ста при этом лгал о ней. Исследователи насчитали 16 типовых приёмов торга в трёх группах: как надавить на других, как подать свою книгу и как собрать сделку.
- Доверие растёт вместе с точностью. Средняя оценка полученной книги — 7,2 из 10. Агенту люди готовы отдать около 30% годового бюджета на книги, начитанному другу — около 40%. Кто считал, что агент ничего не упустил из разговора, доверял бы ему 34% бюджета, остальные — 23%.
Один участник, чей агент час держал для него нужную книгу и в последний момент её обменял, пересмотрел запись торгов и сформулировал главное: в экономике агентов прозрачность процесса важна не меньше результата, потому что только она даёт человеку возможность оспорить итог. Сами исследователи признают пределы опыта: сотрудники Anthropic не похожи на обычных покупателей, агентов-мошенников на площадке не было, а правила рынка не меняли.
Что это значит для бизнеса
Агенты, которые договариваются и покупают за человека, перестают быть фантастикой. Из эксперимента для компаний следуют три практических правила.
Первое — агент ошибается чаще всего там, где плохо понял задачу. Поэтому ему нужны границы полномочий: что он решает сам, а что только предлагает. Чем дороже ошибка, тем уже рамка.
Второе — подтверждение человеком. В опросе люди соглашались отдать агенту без права вето примерно треть книжного бюджета, другу — больше. Деньги, скидки, условия договора и другие значимые решения должен подтверждать живой сотрудник.
Третье — журнал. Разобраться в спорной сделке и вернуть ошибку можно, только если записан весь ход разговора: кто, что и когда сказал, на что согласился.
По тем же правилам работает ИИ-менеджер КАРАДЕСК. Финансовые и другие значимые решения выполняются только с согласованием человека. По каждому действию видно, кто, когда, по какой версии сценария и с каким результатом его выполнил. Команда, вставленная в разговор, письмо или файл, ничего не запускает: исполняются только действия из утверждённого каталога. Где проходит граница между работой ИИ и человека в продажах, мы разбирали в статье про ИИ-агента для продаж. А о том, как ИИ звонит в компании от имени клиента, рассказывали в новости про звонки Gemini за пользователя.
Коротко
- Anthropic опубликовала Project Swap: ИИ-агенты обменивались книгами за 201 сотрудника.
- По короткому разговору агент угадывал вкусы человека в 61% пар книг.
- Людям в среднем досталась примерно пятая книга из десяти, 85% недобора — от неточного понимания вкусов.
- Сильная модель давала заметно более выгодные сделки, «жёсткая» установка — почти ничего.
- Для агентов, которые торгуются за людей, нужны рамки полномочий, подтверждение человеком и полный журнал.
Вопросы и ответы
Что такое Project Swap?
Эксперимент Anthropic: 201 сотрудник доверил ИИ-агентам обмен книгами. Агент узнавал вкусы человека в коротком чате и сам договаривался с агентами коллег на общей площадке.
Насколько хорошо агенты понимали людей?
Совпадение с собственным рейтингом человека — 61% пар книг против 50% при случайном выборе. Это главное слабое место: на неточное понимание вкусов пришлось 85% недобора.
Врали ли агенты при торге?
Почти нет. Из агентов, которые называли книгу-мечту своего человека, солгал о ней примерно один из ста. Но злонамеренных агентов в эксперименте не было.
Можно ли доверить ИИ-агенту покупки и сделки?
По итогам опыта — с ограничениями: чёткие рамки полномочий, подтверждение человеком значимых решений и полный журнал действий, чтобы спорную сделку можно было разобрать.
Продукт: ИИ-менеджер
Обсудим вашу задачу
Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.







