Стэнфорд и Мета дюйм в сторону ИИ, который действует человеку с новой моделью взаимодействия «Чоис»

admin

Присоединяйтесь к нашим ежедневным и еженедельным информационным бюллетеням для последних обновлений и эксклюзивного контента в лидирующем отраслевом освещении искусственного интеллекта. Узнать больше


Исследователи из Stanford University и Meta’s Facebook Ai Research (FAIR) Lab разработали прорывную систему ИИ, которая может генерировать естественные, синхронизированные движения между виртуальными людьми и объектами, основанными исключительно на описаниях текста.

Новая система, получившая дублированную chois (контролируемый синтез взаимодействия человека с человеком), использует новейшие методы модели условной диффузии для производства бесшовных и точных взаимодействий, таких как «Поднимите таблицу над головой, ходьба и положите стол вниз».

Работа, опубликованная в статье о Arxiv, дает представление о будущем, когда виртуальные существа могут понимать и реагировать на языковые команды так же плавно, как и люди.

Кредит: lijiaman.github.io

«Создание непрерывных взаимодействий с человеческим объектом от описаний языков в трехмерных сценах создает несколько проблем»,-отметили исследователи в статье.

Они должны были гарантировать, что генерируемые движения были реалистичными и синхронизированными, поддержав соответствующий контакт между руками и объектами человека, а движение объекта имело причинно -следственную связь с действиями человека.

Как это работает

Система Chois выделяется своим уникальным подходом к синтезу взаимодействий с человеческим объектом в трехмерной среде. По своей сути, Chois использует модель условной диффузии, которая является типом генеративной модели, которая может имитировать подробные последовательности движения.

При данном начальном состоянии человеческих и объектных позиций, наряду с описанием языка желаемой задачи, Чоис генерирует последовательность движений, которые завершаются выполнением задачи.

Например, если инструкция состоит в том, чтобы переместить лампу ближе к дивану, Чоис понимает эту директиву и создает реалистичную анимацию человеческого аватара, поднимающего лампу и размещающий ее рядом с диваном.

Что делает Chois особенно уникальным, так это использование редких путевых точек объекта и описания языков для руководства этими анимациями. Путевые точки действуют как маркеры для ключевых моментов в траектории объекта, гарантируя, что движение не только физически правдоподобно, но и соответствует цели высокого уровня, изложенной языком.

Уникальность Чоиса также заключается в его продвинутой интеграции понимания языка с физическим моделированием. Традиционные модели часто борются за то, чтобы коррелировать язык с пространственными и физическими действиями, особенно в течение более длительного горизонта взаимодействия, где следует учитывать много факторов для поддержания реализма.

Chois преобразует этот разрыв, интерпретируя намерения и стиль, стоящие за описаниями языка, а затем переводя их в последовательность физических движений, которые уважают ограничения как человеческого тела, так и объекта.

Система особенно новаторская, потому что она гарантирует, что точки контакта, такие как руки, касающиеся объекта, точно представлены, и что движение объекта соответствует силам, оказываемым человеческим аватаром. Более того, модель включает в себя специализированные функции потерь и термины руководства на этапах обучения и генерации для обеспечения соблюдения этих физических ограничений, что является значительным шагом вперед в создании ИИ, который может понимать и взаимодействовать с физическим миром человеком, похожим на человека.

Последствия для компьютерной графики, ИИ и робототехники

Последствия системы Chois на компьютерную графику глубоки, особенно в сфере анимации и виртуальной реальности. Позволяя ИИ интерпретировать инструкции по естественному языку для создания реалистичных взаимодействий с человеком и объектом, Chois может резко сократить время и усилия, необходимые для анимирования сложных сцен.

Аниматоры могут потенциально использовать эту технологию для создания последовательностей, которые традиционно требуют кропотливой анимации ключа, что является как трудоемкой, так и трудоемкой. Кроме того, в средах виртуальной реальности Chois может привести к более захватывающим и интерактивным опытам, поскольку пользователи могут командовать виртуальными символами через естественный язык, наблюдая за тем, как они выполняют задачи с жизненной точностью. Этот повышенный уровень взаимодействия может преобразовать VR -опыта из жестких, сценаривых событий в динамические среды, которые реально реагируют на пользовательский ввод.

В областях ИИ и робототехники Чоис представляет гигантский шаг к более автономным и контекстным системам. Роботы, часто ограниченные предварительно запрограммированными процедурами, могут использовать такую ​​систему, как Chois, чтобы лучше понять реальный мир и выполнять задачи, описанные на человеческом языке.

Это может быть особенно преобразующим для служебных роботов в области здравоохранения, гостеприимства или домашней среды, где важна возможность понимать и выполнять широкий спектр задач в физическом пространстве.

Для ИИ способность обрабатывать язык и визуальную информацию одновременно для выполнения задач на шаг ближе к достижению уровня ситуационного и контекстуального понимания, который до сих пор был преимущественно человеческим атрибутом. Это может привести к тому, что системы ИИ, которые являются более полезными помощниками в сложных задачах, способных понять не только «что», но и «как» человеческих инструкций, адаптируясь к новым проблемам с уровнем гибкости, ранее невидимым.

Многообещающие результаты и будущие перспективы

В целом, Стэнфорд и Мета -исследователи добились ключевых прогрессов по чрезвычайно сложной проблеме на пересечении компьютерного зрения, НЛП (обработка естественного языка) и робототехнике.

Исследовательская группа считает, что их работа является важным шагом к созданию передовых систем ИИ, которые имитируют непрерывное поведение человека в различных трехмерных средах. Это также открывает дверь для дальнейшего исследования в области синтеза взаимодействий с человеком с целью трехмерных сцен и языкового ввода, что может привести к более сложным системам ИИ в будущем.



Источник

Вам также может понравиться