Project Swap: Anthropic отправила 201 ИИ-агента торговаться за людей — что вышло из эксперимента

Новости ИИ · · Источник: исследовательский блог компании Anthropic · Редакция КАРАДЕСК

Anthropic опубликовала итоги Project Swap — эксперимента, в котором ИИ-агенты на Claude сами торговались за 201 сотрудника компании. Агенты неплохо понимали вкусы людей и честно вели торг, но главным слабым местом оказалось именно понимание того, чего хочет человек.

Обложка новости — Anthropic: Project Swap: агенты торгуются. 201 сотрудник доверил ИИ обмен книгами — итоги эксперимента. Объёмный знак КАРАДЕСК и значок темы «агент»

Anthropic 24 сентября выложила в исследовательском блоге итоги эксперимента Project Swap. Летом 201 сотрудник из шести офисов принёс по книге, которую готов отдать, коротко рассказал ИИ-агенту о своих вкусах и отпустил его торговаться с агентами коллег. Агенту хватило пятиминутного разговора, чтобы угадать предпочтения человека в 61% пар книг. Случайный выбор дал бы 50%.

Это продолжение прошлого опыта компании, Project Deal, где агенты свободно покупали и продавали за сотрудников всякую всячину. Там было трудно понять, хорошо ли агент сыграл за своего человека. В Project Swap измерять проще: каждый участник заранее сам расставил по порядку 10 книг, и с этим списком сравнивали решения агента.

Что именно проверяли и как торговали агенты

Схема была простой. Человек переписывается с агентом о том, что любит читать. Агент по этому разговору ранжирует все книги своего офиса. Дальше агенты выходят на общую «торговую площадку» и договариваются.

ПараметрПо данным Anthropic
Участники201 сотрудник: Сан-Франциско — 115, Нью-Йорк — 57, Лондон — 12, Сиэтл — 8, Вашингтон — 6, Дублин — 3
Модель в живом раундеу всех агентов Opus 4.8
Правила площадкилимит времени, одновременно говорят лишь несколько агентов, одно сообщение за ход, вся история публична
Виды сделокобмен один на один и обмен по кругу между несколькими участниками
Когда сделка проходиттолько если согласились все её стороны
Установки агентамполовине — «жёсткая» (только выгода своего человека), половине — «с заботой об остальных»
Повторные прогонывсего 205 запусков рынка, в том числе на Haiku 4.5, Sonnet 4.5 и Fable 5

Медианный участник написал агенту всего 216 слов в восьми сообщениях. Кто писал подробнее, тот получил более точного представителя: 300 слов вместо 150 давали примерно на 4 процентных пункта больше совпадений.

Главные выводы

  • Слабое звено — понимание человека, торг идёт хорошо. В среднем люди получили книгу на уровне 0,55 по своей шкале, это примерно пятое место из десяти. Идеальное распределение дало бы 0,89, почти второе место. 85% недобора пришлось на неточное понимание вкусов и только 15% на сам хаотичный торг.
  • Умнее модель — выгоднее сделки. Перевод агента с Haiku на Opus поднимал человека на 0,12 по его списку, с Sonnet на Opus — на 0,08. Особенно заметно это для самых обделённых: у худшей десятой части участников результат на площадках с Haiku был 0,05, а с Opus — 0,38.
  • Жёсткость почти ничего не даёт. «Жёсткий» агент выигрывал у заботливого около 0,02. Заботливые вдвое чаще соглашались на книгу похуже, хотя оба случая редки.
  • Агенты почти не врали. От 78% до 96% агентов в какой-то момент называли книгу-мечту своего человека, и лишь примерно один из ста при этом лгал о ней. Исследователи насчитали 16 типовых приёмов торга в трёх группах: как надавить на других, как подать свою книгу и как собрать сделку.
  • Доверие растёт вместе с точностью. Средняя оценка полученной книги — 7,2 из 10. Агенту люди готовы отдать около 30% годового бюджета на книги, начитанному другу — около 40%. Кто считал, что агент ничего не упустил из разговора, доверял бы ему 34% бюджета, остальные — 23%.

Один участник, чей агент час держал для него нужную книгу и в последний момент её обменял, пересмотрел запись торгов и сформулировал главное: в экономике агентов прозрачность процесса важна не меньше результата, потому что только она даёт человеку возможность оспорить итог. Сами исследователи признают пределы опыта: сотрудники Anthropic не похожи на обычных покупателей, агентов-мошенников на площадке не было, а правила рынка не меняли.

Что это значит для бизнеса

Агенты, которые договариваются и покупают за человека, перестают быть фантастикой. Из эксперимента для компаний следуют три практических правила.

Первое — агент ошибается чаще всего там, где плохо понял задачу. Поэтому ему нужны границы полномочий: что он решает сам, а что только предлагает. Чем дороже ошибка, тем уже рамка.

Второе — подтверждение человеком. В опросе люди соглашались отдать агенту без права вето примерно треть книжного бюджета, другу — больше. Деньги, скидки, условия договора и другие значимые решения должен подтверждать живой сотрудник.

Третье — журнал. Разобраться в спорной сделке и вернуть ошибку можно, только если записан весь ход разговора: кто, что и когда сказал, на что согласился.

По тем же правилам работает ИИ-менеджер КАРАДЕСК. Финансовые и другие значимые решения выполняются только с согласованием человека. По каждому действию видно, кто, когда, по какой версии сценария и с каким результатом его выполнил. Команда, вставленная в разговор, письмо или файл, ничего не запускает: исполняются только действия из утверждённого каталога. Где проходит граница между работой ИИ и человека в продажах, мы разбирали в статье про ИИ-агента для продаж. А о том, как ИИ звонит в компании от имени клиента, рассказывали в новости про звонки Gemini за пользователя.

Коротко

  • Anthropic опубликовала Project Swap: ИИ-агенты обменивались книгами за 201 сотрудника.
  • По короткому разговору агент угадывал вкусы человека в 61% пар книг.
  • Людям в среднем досталась примерно пятая книга из десяти, 85% недобора — от неточного понимания вкусов.
  • Сильная модель давала заметно более выгодные сделки, «жёсткая» установка — почти ничего.
  • Для агентов, которые торгуются за людей, нужны рамки полномочий, подтверждение человеком и полный журнал.

Вопросы и ответы

Что такое Project Swap?

Эксперимент Anthropic: 201 сотрудник доверил ИИ-агентам обмен книгами. Агент узнавал вкусы человека в коротком чате и сам договаривался с агентами коллег на общей площадке.

Насколько хорошо агенты понимали людей?

Совпадение с собственным рейтингом человека — 61% пар книг против 50% при случайном выборе. Это главное слабое место: на неточное понимание вкусов пришлось 85% недобора.

Врали ли агенты при торге?

Почти нет. Из агентов, которые называли книгу-мечту своего человека, солгал о ней примерно один из ста. Но злонамеренных агентов в эксперименте не было.

Можно ли доверить ИИ-агенту покупки и сделки?

По итогам опыта — с ограничениями: чёткие рамки полномочий, подтверждение человеком значимых решений и полный журнал действий, чтобы спорную сделку можно было разобрать.

Продукт: ИИ-менеджер

Обсудим вашу задачу

Оставьте телефон — перезвоним в рабочее время, покажем демонстрацию на вашем сценарии и честно скажем, где ИИ не подойдёт.

Подробнее о продукте «ИИ-менеджер»

Заявка принята

Перезвоним в рабочее время. Спасибо, что дочитали!

Свежие новости ИИ

Обложка новости — Perplexity: Perplexity Fast Search. Веб-поиск для ИИ-агентов за $1 на 1 000 запросов. Объёмный знак КАРАДЕСК и значок темы «агент»25 сентября 2026, 00:16 МСК · Perplexity Fast Search: быстрый веб-поиск для ИИ-агентов в пять раз дешевле обычного — Perplexity запустила Fast Search — облегчённый режим веб-поиска для ИИ-агентов, который стоит 1 доллар за 1 000 запросов вместо 5. Для компаний, чьи агенты ищут в интернете сотни раз за задачу, это прямая экономия на каждом шаге.Обложка новости — Akamai: Anthropic × Akamai: $11,6 млрд. Семь лет облачных мощностей под рост нагрузки на ИИ. Объёмный знак КАРАДЕСК и значок темы «деньги»24 сентября 2026, 23:23 МСК · Anthropic и Akamai: контракт на 11,6 млрд долларов на семь лет вычислительных мощностей — Anthropic подписала с Akamai контракт на 11,6 млрд долларов на семь лет облачных мощностей, сообщила Akamai. Разработчики ИИ скупают вычисления на годы вперёд, и спрос на них уже держит на себе компании, которые раньше были известны совсем другим.Обложка новости — Белый дом: Модели — сначала США. Британские тестировщики ждут, пока модели проверят в Вашингтоне. Объёмный знак КАРАДЕСК и значок темы «закон»24 сентября 2026, 22:17 МСК · Белый дом попросил OpenAI и Anthropic не отдавать новые модели британским тестировщикам до проверки в США — Белый дом попросил OpenAI и Anthropic не передавать новые модели британскому институту безопасности ИИ, пока их не проверят в США. Даже ближайший союзник получает доступ к передовому ИИ только после Вашингтона, и компаниям стоит заранее понимать, от чьих решений зависит их поставщик.Обложка новости — ElevenLabs: ElevenLabs: оценка $22 млрд. Голосовые агенты уже отвечают на звонки крупных компаний. Объёмный знак КАРАДЕСК и значок темы «звук»24 сентября 2026, 19:49 МСК · ElevenLabs оценивают в 22 млрд долларов: глава компании — о голосовых агентах и выручке — Оценка ElevenLabs, по сообщениям СМИ, дошла до 22 млрд долларов, а глава компании в интервью TechCrunch назвал годовую выручку в 600 млн. Голосовые агенты уже снимают трубку за крупные компании, и продажи с сервисом меняются вместе с ними.Обложка новости — Google: Gemini звонит за клиента. ИИ сам узнаёт наличие, ждёт на линии и записывает на приём. Объёмный знак КАРАДЕСК и значок темы «телефон»24 сентября 2026, 19:49 МСК · Gemini Call for Me: Google научила ИИ звонить в компании за пользователя — Google запустила тест Gemini Call for Me: ИИ-ассистент сам звонит в магазин, салон или ресторан от имени пользователя, ждёт на линии и договаривается о записи. Компаниям начинают звонить ИИ-агенты клиентов, и отвечать им придётся так же быстро, как людям.Обложка новости — Google: Gemini 3.8 Live Avatar. Голосовой ИИ получил лицо, мимику и 97 языков. Объёмный знак КАРАДЕСК и значок темы «звук»24 сентября 2026, 19:46 МСК · Gemini Live Avatar: Google дала голосовому ИИ лицо с мимикой и синхронной речью на 97 языках — Google представила Gemini Live Avatar: голосовой ИИ Gemini 3.8 Live теперь говорит с анимированным лицом, двигает губами в такт речи и переключается между 97 языками. Функция вышла для компаний, и клиенты всё быстрее привыкают, что ИИ отвечает сразу и по-человечески.

Читайте в статьях

Обложка статьи — Голосовой робот для звонков или ИИ-менеджер. Плашка «ИИ-менеджер», объёмный знак КАРАДЕСК и значок темы «звук»Голосовые технологии · 7 мин · Голосовой робот для звонков или ИИ-менеджер: в чём разница и что выбрать — Голосовой робот для звонков проигрывает заготовленные фразы и ждёт «да» или «нет». ИИ-менеджер ведёт разговор: отвечает на вопросы, спорит по делу, отправляет КП и записывает итог в CRM. Разница слышна на первом же вопросе, которого нет в сценарии.Обложка статьи — ИИ-менеджер по продажам. звонок, сделка и CRM. Плашка «ИИ-менеджер», объёмный знак КАРАДЕСК и значок темы «телефон»ИИ в продажах · 8 мин · ИИ-менеджер по продажам: как он звонит, продаёт и заносит сделки в CRM — ИИ-менеджер по продажам — голосовой сотрудник, который перезванивает по заявке в первую минуту, ведёт живой разговор, отправляет КП, записывает на встречу и сам заполняет сделку в CRM. Живой менеджер получает клиента с понятной потребностью и полной историей. Ниже — путь одной заявки по минутам и честная граница, за которой нужен человек.Обложка статьи — Коммерческое предложение во время звонка клиенту. Плашка «ИИ-менеджер», объёмный знак КАРАДЕСК и значок темы «телефон»ИИ в продажах · 7 мин · Коммерческое предложение во время звонка: как ИИ-менеджер собирает КП, пока клиент на линии — Коммерческое предложение во время звонка уходит клиенту на почту, пока он ещё на линии: по шаблону компании, с ценами из прайса. Там, где прораб обзванивает поставщиков за двадцать минут, это часто решает, чьё КП откроют первым. Ниже — как это устроено, что подготовить и где без человека нельзя.