Курсор мыши как интерфейс для ИИ: зачем его переизобретают
Указатель мыши почти не менялся с 1980-х. Теперь его пробуют превратить в точку входа для ИИ-агентов — и это меняет привычный сценарий «кликнул и увидел результат».

Стрелка, которой почти сорок лет
Курсор в виде наклонной стрелки придумали в лаборатории Xerox PARC в 1970-х, а массовым его сделал Apple Lisa в 1983 году и следом Macintosh в 1984-м. С тех пор форма почти не изменилась: стрелка для наведения, вертикальная черта для текста, песочные часы или крутящееся колёсико для ожидания. Вся семантика курсора построена вокруг одной идеи — вы сами наводите его на объект и сами решаете, что с ним сделать.
ИИ-агенты ломают эту логику. Если действие на экране инициирует не человек, а модель — куда должен смотреть курсор, кто им управляет и как отличить движение агента от вашего собственного. Этот вопрос последние год-два всё чаще всплывает в разработке — от Anthropic с их Computer Use до экспериментов Google и OpenAI с агентами, которые действуют прямо в браузере и на рабочем столе.
Почему старый курсор не годится агенту
Классический указатель решает три задачи: показывает, где вы находитесь; сигнализирует, что под ним можно сделать (сменой формы); отражает состояние системы (ожидание, перетаскивание). Всё это рассчитано на одного оператора — человека с рукой на мыши.
Когда за штурвал садится модель, возникают вещи, для которых у интерфейса нет словаря:
- Кто сейчас действует. Если агент двигает курсор сам, пользователь должен мгновенно понимать, что это не его движение, иначе борьба за управление превращается в хаос.
- Что агент собирается сделать дальше. Человек видит цель клика заранее по контексту. Модель этого не подсказывает — она просто кликает.
- Где граница вмешательства. Нужен способ перехватить управление на полпути, не дожидаясь, пока агент закончит цепочку из десяти действий.
Курсор перестаёт быть продолжением руки и становится курсором двух сущностей сразу — человека и модели. А для двух водителей одна педаль газа не работает.
Что уже пробуют
Единого стандарта нет, но в продуктах и прототипах видно несколько подходов. Ни один из них пока не выиграл — это скорее поле для эксперимента, чем сложившаяся практика.
| Подход | Идея | Слабое место |
|---|---|---|
| Отдельный «агентский» курсор | Второй указатель другого цвета или формы, которым управляет модель | Два курсора на экране путают, особенно если оба двигаются |
| Подсветка намерения | Перед кликом агент подсвечивает элемент, куда собирается нажать | Замедляет работу, теряется смысл автоматизации |
| Курсор-статус | Указатель меняет вид, показывая «думаю», «действую», «жду подтверждения» | Возврат к песочным часам, только сложнее |
| Курсор без курсора | Агент работает через API и DOM*, не трогая экранный указатель вовсе | Не работает там, где нет API — а таких приложений большинство |
* DOM (Document Object Model) — программное представление структуры веб-страницы, к которому можно обращаться из кода, минуя визуальный интерфейс.
Почему «курсор без курсора» не решает всё
Самый чистый инженерный путь — вообще не двигать пиксельный указатель, а работать с приложением напрямую через программный интерфейс. Так поступают многие браузерные агенты. Проблема в том, что львиная доля софта, особенно десктопного и корпоративного, не отдаёт удобного API. Агенту приходится буквально смотреть на скриншот экрана, распознавать кнопки и кликать по координатам — то есть возвращаться к курсору как к единственному общему языку между человеком, ИИ и приложением.
Курсор как канал доверия
Главная функция, которой у старого указателя не было, — это доверие. Когда агент совершает необратимое действие (отправляет письмо, удаляет файл, подтверждает платёж), пользователь должен видеть это раньше, чем оно случится. Курсор оказывается удобным местом для такого сигнала: он уже находится там, куда вы смотрите.
Отсюда идея «курсора с подтверждением»: агент подводит указатель к кнопке, останавливается и ждёт вашего одобрения — кликом, горячей клавишей или голосом. Это компромисс между полной автоматизацией и полным контролем. За скорость приходится платить паузами, но для рискованных операций пауза дешевле отката.
Что это меняет для разработчиков
Если вы делаете десктопное или веб-приложение, к которому потенциально будут обращаться агенты, стоит думать о нескольких вещах уже сейчас:
- Стабильные и осмысленные атрибуты элементов. Кнопка с понятным идентификатором и подписью распознаётся моделью надёжнее, чем безымянный div.
- Явные состояния необратимости. Диалоги подтверждения перед удалением и оплатой полезны не только человеку, но и агенту как точка остановки.
- Возможность перехвата. Пользователь должен уметь прервать агента одним движением — это вопрос не только UX, но и безопасности.
Стоит ли ждать нового стандарта
Скорее всего, единого «курсора для ИИ» в ближайшее время не появится — как не появилось единого жеста для тач-интерфейсов сразу. Разные платформы будут пробовать разное, и часть решений отомрёт. Но направление уже понятно: указатель перестаёт быть немым продолжением руки и становится точкой, где встречаются намерение человека, действие модели и согласие на это действие.
Цена вопроса для пользователя простая. Если интерфейс не научится показывать, кто сейчас управляет и что произойдёт дальше, доверять агенту необратимые операции будет страшно — а значит, автоматизация останется игрушкой для безопасных задач. Курсор, который умеет спросить «уверены?» в нужный момент, стоит дороже, чем курсор, который просто быстро кликает.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: Anthropic — Introducing computer use
Частые вопросы
Существует ли уже стандартный «ИИ-курсор»?
Зачем агенту вообще двигать курсор, если есть API?
Как понять, что курсором сейчас управляет ИИ, а не я?
Опасно ли доверять агенту клики на моём экране?
Что учесть разработчику приложения уже сейчас?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту.