2026 г.

Технологии искусственного интеллекта: карта области

Проект ЦИТадель

Термин «искусственный интеллект» используют и для чат-ботов, и для систем распознавания лиц, рекомендательных алгоритмов, диагностических моделей и автономных машин. Это не одна технология, а широкая область методов и прикладных систем. Задача статьи — дать её карту: показать, как связаны основные подходы, для каких задач они подходят и где проходят границы их применимости. Определения собраны также в глоссарии, а отдельные направления разобраны в следующих материалах раздела.

Важно не смешивать уровни этой карты. Искусственный интеллект шире машинного обучения: к нему относятся также поиск, планирование, логический вывод и системы правил. Машинное обучение строит модели по данным, а глубокое обучение является его частью, основанной на многослойных нейронных сетях. «Генеративный ИИ» обозначает способность создавать новые данные; генеративными могут быть и языковые, и визуальные, и звуковые модели.

1. От символьного ИИ к машинному обучению

Название научного направления связано с предложением Дартмутского летнего исследовательского проекта 1955 года и самой встречей 1956 года. В первые десятилетия заметную роль играл символьный подход: знания представляли формальными правилами, логическими выражениями и структурами, над которыми программа выполняла поиск и вывод. Так появились экспертные системы, логическое программирование и автоматическое доказательство теорем.

Символьные методы хорошо работают там, где правила и ограничения можно сформулировать достаточно полно. Но ручное накопление знаний оказалось дорогим, а системы — хрупкими при столкновении с неоднозначными текстами, изображениями и ситуациями, не предусмотренными авторами правил. Несколько спадов финансирования и ожиданий обычно объединяют под названием «зимы ИИ»; чаще всего выделяют периоды середины 1970-х и конца 1980-х — начала 1990-х годов.

По мере роста цифровых данных и вычислительных ресурсов всё больше задач стали решать с помощью машинного обучения (machine learning): алгоритм настраивает параметры модели по примерам, а не получает полный набор правил вручную. Это не отменило символические методы. Поиск, ограничения, базы знаний и программная логика по-прежнему используются самостоятельно и вместе с обучаемыми моделями.

Модель оценивают не по тому, насколько точно она воспроизводит обучающие примеры, а по качеству на новых данных из предполагаемой области применения. Такая способность называется обобщением (generalization). Она зависит не только от алгоритма, но и от того, насколько обучающая и контрольная выборки представляют реальные условия и не содержат утечек.

2. Классическое машинное обучение

Под классическим машинным обучением обычно понимают методы, не требующие глубоких нейронных сетей: линейную и логистическую регрессию, метод опорных векторов, деревья решений, случайные леса, градиентный бустинг, метод ближайших соседей и вероятностные модели. В обучении с учителем (supervised learning) каждому примеру соответствует целевая метка или число. В обучении без учителя (unsupervised learning) меток нет: алгоритм ищет кластеры, аномалии и другую структуру. Обучение с подкреплением использует иной сигнал — вознаграждение за последовательность действий — и рассмотрено ниже.

Для табличных задач деревья и градиентный бустинг остаются сильными базовыми решениями: на многих наборах умеренного размера они точнее или экономичнее нейронных сетей. Это не универсальный закон — результат зависит от объёма и структуры данных, метрики, настройки и допустимой задержки. Сравнивать следует на одной схеме валидации, учитывающей время, группы объектов и возможные утечки. Практический цикл описан во введении в классическое ML, а деревьям и реализациям XGBoost, LightGBM и CatBoost посвящена отдельная статья.

3. Глубокое обучение

Искусственные нейронные сети исследуются с середины XX века. Метод обратного распространения ошибки (backpropagation) получил широкую известность после работ 1980-х годов, но глубина сети сама по себе долго не гарантировала успешного обучения. Прогресс обеспечила совокупность факторов: крупные наборы данных, GPU и другие ускорители, новые функции активации, способы инициализации и регуляризации, а также более подходящие архитектуры. Победа AlexNet в соревновании ImageNet 2012 года стала особенно заметной демонстрацией этого сдвига в компьютерном зрении.

Глубокое обучение (deep learning) использует многослойные сети, которые совместно с основной задачей строят внутренние представления данных. Для изображений часто наблюдается переход от локальных контуров к более сложным сочетаниям признаков, но это полезная интуиция, а не жёсткое правило для каждого слоя и каждой архитектуры. В отличие от конвейера с полностью заданными вручную признаками, сеть может извлекать значительную часть представления из пикселей, звука или текста. При этом выбор данных, архитектуры, функции потерь и предобработки остаётся инженерным решением.

Требования к ресурсам различаются на много порядков. Небольшую сеть можно обучить на одной машине, тогда как предобучение передовой универсальной модели требует крупных кластеров, энергии, сетевой инфраструктуры и сложного программного стека. Поэтому важно различать обучение с нуля, дообучение готовой модели и инференс: у них разные бюджеты и ограничения.

4. Компьютерное зрение

Компьютерное зрение (computer vision) стало одной из первых областей, где преимущества глубокого обучения получили широкую практическую демонстрацию. Основные задачи: классификация изображения, детекция объектов и определение их координат, сегментация пикселей, оценка позы, чтение текста (OCR), отслеживание объектов и анализ видео. Эти задачи требуют разных метрик и по-разному реагируют на ошибки.

Свёрточные нейронные сети (convolutional neural networks, CNN) используют предположение о локальности: фильтр обрабатывает небольшую область и применяется в разных частях изображения. Визуальный трансформер (Vision Transformer, ViT) разбивает изображение на фрагменты и обрабатывает их механизмом внимания. Трансформеры не отменили CNN: выбор между ними и гибридными архитектурами зависит от данных, вычислительного бюджета и задачи. Модели, совместно обученные на изображениях и текстах, позволяют искать изображения по описанию, отвечать на вопросы о них и переносить знания между задачами.

Зрение применяется для контроля качества, обработки документов, медицинских изображений, навигации и видеонаблюдения. Публикация хорошей метрики на тестовом наборе ещё не подтверждает готовность системы к этим сценариям: нужны проверка на данных конкретной среды, оценка редких ошибок, мониторинг сдвига данных и безопасная реакция на неопределённость. Для лиц, медицины и транспорта к этому добавляются требования к приватности, справедливости и ответственности за последствия решения.

5. Обработка естественного языка и большие языковые модели

Обработка естественного языка (natural language processing, NLP) включает морфологический и синтаксический анализ, извлечение сущностей, поиск, машинный перевод, классификацию, суммаризацию и ответы на вопросы. До распространения универсального предобучения для многих задач создавали отдельные модели и размеченные корпуса; специализированные решения остаются полезными и сегодня, когда важны малая задержка, воспроизводимость или строгая схема вывода.

Архитектура трансформер, предложенная в 2017 году, сделала предобучение больших моделей на последовательностях хорошо масштабируемым. Большинство современных генеративных LLM обучается самоконтролируемо: модель предсказывает следующий токен, то есть единицу токенизатора, по предыдущему контексту. Существуют и другие цели, например восстановление скрытых токенов. Обучающие корпуса обычно смешивают веб-страницы, книги, код и другие данные, но их состав, объём и правовой статус различаются у разных моделей.

Предобученная LLM способна переносить усвоенные статистические закономерности на перевод, суммаризацию, ответы на вопросы и программный код, в том числе по инструкции и нескольким примерам в контексте. Это полезное обобщение, но не доказательство человеческого понимания или надёжного логического вывода. Правдоподобное объяснение модели может быть ошибочным и не обязано точно отражать внутренний процесс получения ответа.

Диалоговый продукт — не только базовая модель. Он может включать дообучение на инструкциях, оптимизацию по предпочтениям или проверяемым наградам, системные правила, поиск, инструменты и программные ограничения; конкретные сочетания различаются и меняются. Вокруг LLM сложились методы промптинга, RAG (retrieval-augmented generation), вызова функций, агентных циклов и дообучения. Их последовательно разбирает учебник «Большие языковые модели».

Основные ограничения следуют из способа построения таких систем. Модель может уверенно сгенерировать недостоверное утверждение, а её параметрические знания ограничены обучающими данными. Поиск и инструменты дают доступ к более свежей информации, но не гарантируют правильного выбора и толкования источника. Контекст может содержать персональные данные или вредоносные инструкции, а действия агента — иметь внешние последствия. Поэтому проверка источников, разграничение доступа и оценка на собственных задачах являются частью системы, а не необязательным дополнением.

6. Генеративные модели: изображения, видео, звук

LLM являются частным случаем генеративных моделей, которые оценивают распределение данных или учатся преобразованию, позволяющему получать новые примеры. Для изображений и видео применяются диффузионные модели, методы согласования потоков (flow matching) и авторегрессионная генерация. Упрощённая интуиция диффузионной модели такова: при обучении сеть осваивает обращение процесса зашумления, а при генерации превращает случайный шум в изображение с заданными условиями. Реальные системы могут работать в сжатом латентном пространстве и сочетать несколько архитектур.

Генерация изображений, видео, речи и музыки стала доступной как через готовые сервисы, так и через модели с доступными весами. Качество зависит от языка, жанра, длительности и способа оценки; реалистичность не означает фактическую достоверность. Для клонирования голоса и изображения человека необходимы согласие, контроль доступа и правила публикации.

Дипфейки создают риск мошенничества, травли и ложной атрибуции. Детектор, обученный на известных генераторах, может потерять качество на новом методе или после редактирования файла, поэтому универсального теста «сгенерировано или нет» нет. Водяные знаки и стандарты происхождения контента, например C2PA, дают полезные сигналы, но отсутствие метки не доказывает подлинность, а корректная подпись подтверждает происхождение и целостность заявленных сведений, не истинность самого содержания.

7. Распознавание и синтез речи

Распознавание речи (speech-to-text, STT) преобразует аудио в текст, а синтез речи (text-to-speech, TTS) решает обратную задачу. Нейронные модели заметно улучшили оба направления; Whisper стал влиятельным примером универсальной многоязычной модели распознавания. Но качество нельзя описывать одной цифрой: оно зависит от языка и диалекта, предметной области, шума, микрофона, числа говорящих и требуемой точности имён и чисел.

Голосовой ассистент можно построить каскадом STT → LLM → TTS. Текстовые промежуточные результаты удобно журналировать, проверять и ограничивать. Модели, принимающие и порождающие аудио напрямую, могут лучше сохранять интонацию и уменьшать задержку, но требуют собственных способов контроля и оценки. В обоих случаях важны потоковая обработка, определение начала и конца реплики, перебивания, эхоподавление, разделение говорящих и стабильная задержка. Голос и записи разговоров являются чувствительными данными, поэтому нужны понятные сроки хранения и согласие на использование.

8. Обучение с подкреплением

В обучении с подкреплением (reinforcement learning, RL) агент выбирает действия, получает наблюдения и вознаграждение и учится стратегии, максимизирующей ожидаемую сумму будущих наград. Сигнал может быть редким и запаздывающим, а действие влияет на следующие состояния, поэтому задача не сводится к независимому правильному ответу для каждого примера. Обучение возможно в симуляции, по записанным траекториям или при контролируемом взаимодействии с реальной средой.

Игры дали RL наглядные и хорошо измеримые задачи. AlphaGo сочетала обучение на партиях экспертов, подкрепление в самоигре и поиск по дереву, а в 2016 году победила Ли Седоля. В робототехнике и управлении RL применяется избирательно: исследовательский результат в симуляторе ещё нужно перенести в среду с шумом, ограничениями безопасности и дорогими ошибками.

В языковых моделях RL используют на некоторых этапах постобучения. В RLHF модель вознаграждения приближает человеческие предпочтения; в задачах с проверяемым ответом награду может вычислять программа или формальный проверяющий. Существуют и методы оптимизации предпочтений без цикла RL, например DPO. Ни один из этих подходов не гарантирует истинность или соответствие намерению: модель может использовать слабость проверяющего или оптимизировать измеряемый показатель в ущерб реальной цели. Подробнее это разобрано в главе о постобучении.

9. Мультимодальность: объединение данных разных типов

Мультимодальная модель принимает или порождает данные нескольких типов: текст, изображения, звук или видео. Она может отвечать на вопросы о фотографии, разбирать схему, сопоставлять речь с видеорядом или создавать описание документа. Это не обязательно одна однородная сеть: система может иметь отдельные кодировщики и декодировщики модальностей, проекторы в общее пространство и трансформер, объединяющий полученные представления. Понятие «токен» также реализуется для текста, изображения и аудио по-разному.

Отдельное направление — vision-language-action модели (VLA), которые связывают зрительные наблюдения и языковые команды с действиями робота. Предобучение на изображениях и текстах помогает переносить понятия на новые объекты и команды, но не снимает проблем физической надёжности: роботу нужны пространственная точность, обратная связь, ограничение усилий, обработка нештатных ситуаций и проверяемый безопасный контур управления.

10. Практические вопросы

Постановка и данные. До выбора модели нужно определить единицу решения, допустимую ошибку и способ измерения качества. Затем проверяют происхождение, полноту и репрезентативность данных, отделяют обучающую, валидационную и закрытую тестовую выборки. Подготовка и разметка часто составляют значительную часть проекта. Для больших корпусов дополнительно важны дубликаты, загрязнение тестов, персональные данные, согласие и права на использование текстов, изображений и записей.

Вычисления. Предобучение передовых универсальных моделей доступно ограниченному числу организаций, но большинство прикладных команд использует готовую модель через API, дообучает доступные веса или запускает их локально. Цена и задержка зависят от размера модели, длины контекста, пакетной обработки, аппаратуры и требований к доступности. Квантизация уменьшает память и иногда ускоряет инференс за счёт пониженной точности представления весов; влияние на качество нужно измерять на своей задаче. Практические аспекты разобраны в главах о локальном запуске и стоимости систем.

Доступ к модели. Между закрытым API и полностью открытым проектом есть много промежуточных вариантов. «Открытые веса» не означают автоматически открытый исходный код, свободную лицензию или опубликованные обучающие данные. Локальный запуск даёт контроль над запросами только тогда, когда локальны также журналы, хранилища, зависимости и средства мониторинга; при этом команда оплачивает оборудование и эксплуатацию. API снимает часть этой работы, но добавляет договорные ограничения, зависимость от провайдера и вопросы передачи данных. Актуальные варианты вынесены в обновляемый обзор моделей.

Качество и безопасность. Демонстрация модели не заменяет репрезентативный набор проверок. Для рабочей системы нужны базовый вариант без ИИ, измерение полезности и цены ошибок, тесты отказов, мониторинг изменений и возможность отката. Модельный вывод следует считать недоверенными данными, а доступ к поиску, коду и внешним действиям выдавать по минимальным полномочиям. Этим вопросам посвящены главы об оценке качества и безопасности.

Регулирование. Обязанности зависят не от слова «ИИ» в названии, а от юрисдикции, роли организации, данных и последствий применения. AI Act Европейского союза использует риск-ориентированную схему и вводится поэтапно: часть запретов, правил для моделей общего назначения и требований прозрачности уже действует, а отдельные требования к высокорисковым системам имеют более поздние сроки. В других странах действуют собственные горизонтальные, отраслевые и региональные правила. Кроме специальных законов об ИИ применимы нормы о персональных данных, авторском праве, защите потребителей, медицине, финансах и безопасности продукции.

11. Вместо заключения

Карта области неизбежно упрощает границы между направлениями. Устойчивый ориентир здесь не название технологии, а последовательность инженерных вопросов: какую задачу и для кого решаем; какие ошибки допустимы; есть ли подходящие данные и метрика; нужен ли обучаемый компонент; достаточно ли классической модели; оправданы ли глубокая сеть, генерация или агентный цикл; как система будет проверяться, ограничиваться и сопровождаться.

Для дальнейшего чтения используйте глоссарий, материалы о классическом машинном обучении и градиентном бустинге, учебник по большим языковым моделям и обновляемый обзор моделей, а также подборку научных публикаций. Такое разделение позволяет сохранять фундаментальную карту стабильной, а названия продуктов, цены и доступность обновлять отдельно.

Список литературы и документов

  1. Dartmouth College, «Where AI Was Born»: история Дартмутского проекта и предложения 1955 года. ai.dartmouth.edu
  2. D. E. Rumelhart, G. E. Hinton, R. J. Williams, «Learning representations by back-propagating errors», Nature, 1986. doi.org/10.1038/323533a0
  3. A. Krizhevsky, I. Sutskever, G. E. Hinton, «ImageNet Classification with Deep Convolutional Neural Networks», NeurIPS, 2012. proceedings.neurips.cc
  4. L. Grinsztajn, E. Oyallon, G. Varoquaux, «Why do tree-based models still outperform deep learning on tabular data?», 2022. arxiv.org/abs/2207.08815
  5. A. Vaswani et al., «Attention Is All You Need», 2017. arxiv.org/abs/1706.03762
  6. A. Dosovitskiy et al., «An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale», 2020. arxiv.org/abs/2010.11929
  7. J. Ho, A. Jain, P. Abbeel, «Denoising Diffusion Probabilistic Models», NeurIPS, 2020. proceedings.neurips.cc
  8. D. Silver et al., «Mastering the game of Go with deep neural networks and tree search», Nature, 2016. doi.org/10.1038/nature16961
  9. L. Ouyang et al., «Training language models to follow instructions with human feedback», 2022. arxiv.org/abs/2203.02155
  10. OpenAI, «Whisper»: документация многоязычной модели распознавания речи. developers.openai.com
  11. A. Brohan et al., «RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control», 2023. arxiv.org/abs/2307.15818
  12. Coalition for Content Provenance and Authenticity, C2PA Technical Specification 2.3, 2026. spec.c2pa.org
  13. European Commission, «AI Act: regulatory framework for artificial intelligence». digital-strategy.ec.europa.eu
404 Not Found

404 Not Found


nginx/1.24.0 (Ubuntu)

Связь с редакцией