Опыт Google: как разрабатывают приложения обработки естественного языка на основе искусственного интеллекта
Американская транснациональная корпорация Google уже долгое время занимается разработкой технологий искусственного интеллекта, включая приложения для обработки естественного языка (NLP) в режиме реального времени.
О дивный новый мир возможностей чат-бота BardAl: от перевода текста до анализа настроения
Специалисты подразделения Google AI создали сервис разговорного ИИ чат-бот BardAI, построенный на нейронной языковой модели для диалоговых приложений LaMDA. Эта модель способна обрабатывать цепочки слов и предложений, определять их взаимосвязь друг с другом, и на основе метода прогнозирования осуществлять выдачу ответа на запрос. BardAI может использоваться для решения широкого спектра задач:
· Языковой перевод. Позволяет обрабатывать текст на одном языке и генерировать точный и быстрый его перевод на любой другой язык, что делает BardAI полезным инструментом для преодоления языковых барьеров.
· Генерация текста. Позволяет создавать текстовые ответы на запросы, похожие на человеческие. Эта функция позволяет использовать чат-бот для создания приложений, способных давать ответы на онлайн-форумах, осуществлять подбор материалов для публикаций в социальных сетях.
· Обобщение текста. BardAI может использоваться для составления резюме или публикаций статей, предоставляет возможность получать краткий обзор текста, экономя время пользователей, которым необходимо оставаться в курсе определенной темы.
· Анализ настроения. Помогает понять общий тон и эмоции, передаваемые в письменном виде, а также определять настроение в отзывах клиентов. Такая функция позволяет компаниям работать над улучшением предоставляемых услуг.
На данном этапе чат-бот отвечает на текстовые запросы только в письменном виде, однако в дальнейшем разработчики намерены обеспечить звуковой способ общения «человек-машина».
Языковые титаны: BardAI и его соперники
У чат-бота Google Bard AI есть сильные конкуренты, например, языковые модели компаний OpenAI «GPT-3» и Microsoft «Bing AI». Сравнительный анализ приложения Google с языковыми моделями OpenAI и Microsoft позволяет утверждать, что у всех трех систем есть свои сильные и слабые стороны, и выбор между ними зависит от конкретного варианта использования. Однако на данный момент у этих моделей чат-ботов есть общий недостаток – ограниченность знаний из-за того, что они обучены на не обновляемых базах данных, в результате чего они могут выдавать неверные ответы и вводить пользователя в заблуждение.
SLING: обогащение Wikipedia
Кроме того, инженерами Google AI разработана система SLING – анализатор семантики фреймов естественного языка, предназначенный для чтения и понимания статей Wikipedia на разных языках. Это делается для пополнения базы знаний, например, путем добавления фактов из Wikipedia и других источников в базу знаний Wikidata. Семантика фреймов используется как способ представления информации и аннотаций в документах. Это поддерживает общий анализ нейронной сети на основе переходов с двунаправленным входным кодированием (Long short-term memory, LSTM) и рекуррентного блока на основе переходов (Transition Based Recurrent Unit) для декодирования выходных данных. Модель синтаксического анализа обучается, используя в качестве входных данных только текстовые токены.
В настоящее время программисты компании работают над усовершенствованием данного проекта. С этой целью создан ряд подсистем, необходимых для нормального его функционирования:
· хранилище фреймов SLING – базовая платформа для построения структур семантического графа фреймов и управления ими;
· конвейер Wiki flow, который преобразует файлы Wikipedia в набор документов со структурированными аннотациями, а также позволяет создать таблицы фраз, которые используются для сопоставления имен с объектами;
· SLING Python API, обеспечивающий доступ к информации;
· бот, осуществляющий загрузку извлеченной информации в Wilidata.
WaveNet: ИИ обретает голос
Специалистами дочерней компании Google DeepMind была создана система преобразования текста в речь WaveNet. Функционирование данной модели реализовано на основе нейронной сети, которая была настроена с использованием большого объема образцов речи. Во время обучения сеть извлекала базовую структуру, изучала звучание тонов и то, как выглядит реалистичная форма речевого сигнала.
В отличии от большинства других аналогичных систем, платформа WaveNet может генерировать соответствующие речевые сигналы с нуля, по одному сэмплу за раз, со скоростью до 24 тысяч сэмплов в секунду и плавными переходами между отдельными звуками. Это наделяет голосовой синтезатор возможностью воспроизводить натуральную интонацию.
LipNet: визуальное распознавание речи
Кроме того, инженеры DeepMind разработали нейросеть LipNet, которая распознает речь с помощью чтения по мимике губ. LipNet обучали с использованием метода нейросетевой темпоральной классификации. Этот метод не требует обучения на наборе входных данных, синхронизированных с правильным выходным результатом. На вход платформы подавали последовательность кадров, которые обрабатывались тремя слоями пространственно-временной свёрточной нейросети, каждый из которых, в свою очередь, сопровождался слоем пространственной выборки. Для извлечённых признаков повышалась частота дискретизации по шкале времени, а далее они обрабатывались двойной LTSM. Такой подход не только превышает точность распознавания, но и превосходит эффективность чтения по губам специально обученных людей.
