Большие языковые модели: что умеют, где врут и кому мешают
LLM за три года прошли путь от игрушки до инструмента, которым пользуются юристы, программисты и школьники. Разбираем, что у них внутри, где их предел и во сколько обходится час работы.
За октябрь 2024 года ChatGPT перевалил за 250 миллионов еженедельных пользователей — данные самой OpenAI. Anthropic не раскрывает цифр по Claude, но привлёк 4 миллиарда долларов от Amazon и ещё 2 от Google. Meta раздаёт Llama бесплатно и уже собрала более 650 миллионов загрузок. За этим ажиотажем легко потерять главное: что языковые модели умеют на самом деле, где ломаются и какой ценой обходится их работа — для бизнеса, для рынка труда и для энергосети.
Что модель делает под капотом
LLM — это статистический предсказатель следующего токена*. Модель обучили на терабайтах текста, и она выучила распределение вероятностей: какое слово вероятнее идёт после какого. Всё остальное — рассуждения, код, переводы — надстройка над этим механизмом.
* Токен — фрагмент текста длиной в среднем 3–4 символа. Слово «привет» — один токен, «антидисциплинарный» — четыре.
Из этой природы вытекают две вещи. Первое: модель не знает, где заканчиваются её знания и начинается фантазия. Второе: она отлично воспроизводит форму (юридический документ, письмо, sql-запрос), даже когда содержание неверно. Именно поэтому галлюцинации — не баг, а прямое следствие устройства.
Что они реально умеют
Практический список коротко:
- писать и рефакторить код — GitHub заявляет, что Copilot генерирует до 46% строк в файлах, где его включили;
- суммировать документы на 50–100 страниц с приемлемой точностью;
- переводить между популярными языками на уровне профессионала для не специализированных текстов;
- отвечать на вопросы по загруженным PDF, если использовать связку RAG;
- вести структурированный диалог с вызовом внешних API — то, что называют «агентами».
Появление reasoning-моделей (o1, o3, DeepSeek-R1, Claude с extended thinking) сдвинуло планку в математике и программировании. o1 от OpenAI показала 83% на квалификационном экзамене IMO против 13% у GPT-4o — цифры из отчёта OpenAI за сентябрь 2024.
Где они ломаются
Есть класс задач, где LLM стабильно проваливаются, и это не лечится масштабированием параметров.
- Арифметика с длинными числами. Умножение двух семизначных чисел без калькулятора — не более 30% точности даже у топовых моделей.
- Актуальные факты. Модель знает мир на дату отсечения обучения. Без веб-поиска она уверенно сообщит вам курс валют трёхлетней давности как текущий.
- Логика с отрицаниями и подсчётом. «Сколько букв r в слове strawberry» стало мемом не случайно — токенизация мешает считать символы.
- Знание о собственном знании. Модель не умеет надёжно сказать «не знаю». Она скажет то, что статистически похоже на ответ.
Галлюцинация — это не ошибка модели, это её нормальный режим работы. Ошибка — считать любой её ответ по умолчанию правдой.
Сколько это стоит
Цена запроса упала на порядок за полтора года. Сравнение по прайсам провайдеров на ноябрь 2024, за 1 миллион входных токенов:
| Модель | Вход, $ | Выход, $ | Контекст, токенов |
|---|---|---|---|
| GPT-4o | 2,50 | 10,00 | 128k |
| GPT-4o mini | 0,15 | 0,60 | 128k |
| Claude 3.5 Sonnet | 3,00 | 15,00 | 200k |
| Claude 3.5 Haiku | 0,80 | 4,00 | 200k |
| Gemini 1.5 Pro | 1,25 | 5,00 | 2M |
| DeepSeek V2.5 | 0,14 | 0,28 | 128k |
Что это значит на практике. Обработать книгу на 300 страниц (около 150 тысяч токенов) через GPT-4o mini — примерно 2 цента, или 2 рубля. Через Claude Sonnet — 45 центов, около 45 рублей. Разница в 20 раз при отличии в качестве на конкретной задаче, часто, в 10–15%.
Для сборки RAG-пайплайна на минимальном стеке достаточно нескольких строк:
from openai import OpenAI
client = OpenAI()
response = client.chat.completions.create(
model="gpt-4o-mini",
messages=[
{"role": "system", "content": "Отвечай только на основе контекста."},
{"role": "user", "content": f"Контекст: {docs}\n\nВопрос: {query}"}
],
temperature=0
)
Что происходит с людьми и обществом
Рынок труда
Исследование МВФ от января 2024 оценило, что в развитых экономиках 60% рабочих мест подвержены влиянию ИИ, причём для половины из них это означает риск, а не помощь. Первыми под удар попали не грузчики, как ждали футурологи, а младшие копирайтеры, переводчики шаблонных документов и колл-центры первой линии.
Образование
Домашнее задание в старом формате умерло. Университеты либо переносят проверку знаний в аудиторию, либо интегрируют LLM в процесс и учат ими пользоваться. Средней позиции больше нет.
Информационная среда
Стоимость производства правдоподобного текста упала до нуля. Это одинаково удобно и для маркетолога, и для оператора дезинформационной кампании. Классификаторы «сгенерировано ИИ» работают плохо: OpenAI закрыла свой в 2023 году с формулировкой «низкая точность».
Энергия
По данным МЭА, датацентры в 2022 году потребили около 460 ТВт·ч, к 2026 прогноз — до 1000 ТВт·ч. Заметная часть роста — обучение и инференс LLM. Microsoft и Google в отчётах 2024 года признали, что их цели по углеродной нейтральности отодвигаются именно из-за ИИ-нагрузки.
Как выбирать модель под задачу
- Если нужен массовый простой инференс (классификация, извлечение) — GPT-4o mini, Haiku, Gemini Flash, DeepSeek. Разница в качестве мала, разница в цене — в разы.
- Если задача — код или сложное рассуждение — Claude 3.5 Sonnet и o1/o3. Здесь переплата оправдана.
- Если данные не должны покидать периметр — Llama 3.3 70B или Qwen 2.5 на своём GPU. Порог входа — одна H100 или две A100, аренда от 2 долларов в час.
- Если контекст больше 200 тысяч токенов — Gemini 1.5 Pro пока безальтернативен.
Языковые модели — это не «искусственный разум» и не «продвинутый автозаполнитель». Это новый вычислительный примитив, у которого есть измеримые характеристики: точность на бенчмарках, цена за токен, задержка, потолок контекста. Работать с ним осмысленно — значит знать эти характеристики так же, как раньше знали параметры базы данных.
Prompt-инженер: Идеальные запросы для Midjourney, ChatGPT и других моделей.
Спросить за 15 ₽Источники: OpenAI o1 System Card, IMF: Gen-AI: Artificial Intelligence and the Future of Work
Частые вопросы
Почему LLM галлюцинируют и можно ли это починить?
Насколько reasoning-модели вроде o1 действительно умнее обычных?
Стоит ли разворачивать open-source модель у себя вместо API?
Заменит ли LLM программистов?
Как понять, что текст сгенерирован ИИ?
Сколько энергии тратится на один запрос к ChatGPT?
Материал носит информационный характер и подготовлен редакцией «Агентуры». Он не является офертой, рекламой или индивидуальной консультацией. Упомянутые продукты, компании и торговые знаки принадлежат их правообладателям. Перед принятием решений, влекущих юридические или финансовые последствия, обратитесь к профильному специалисту. Компания Meta Platforms Inc. признана в России экстремистской организацией; её деятельность на территории Российской Федерации запрещена.