Apple разработала ИИ-модель ILuvUI для анализа интерфейсов мобильных приложений

Пост опубликован в блогах iXBT.com, его автор не имеет отношения к редакции iXBT.com
| Новость | ИИ, сервисы и приложения

Исследовательская группа Apple в партнерстве с Университетом Аалто (Финляндия) разработала новую модель искусственного интеллекта ILuvUI, способную интерпретировать интерфейсы мобильных приложений на основе скриншотов и естественного языка. Модель представлена в научной работе «ILuvUI: Instruction-tuned LangUage-Vision моделирование пользовательских интерфейсов на основе машинного диалога».

Ключевая особенность разработки заключается в способности системы анализировать пользовательские интерфейсы как визуально, так и семантически, что отражает естественный способ взаимодействия людей с цифровыми продуктами. В отличие от большинства существующих моделей «зрение-язык» (VLM), которые обучаются преимущественно на естественных изображениях, ILuvUI специализируется именно на распознавании и понимании элементов интерфейса приложений.

Автор: Freepik Источник: ru.freepik.com

Техническая реализация проекта основана на доработке модели с открытым исходным кодом LLaVA. Исследователи адаптировали методологию обучения для специализации в области UI и создали синтетический набор данных, включающий пары «текст-изображение». Обучающий датасет содержал взаимодействия в формате вопросов и ответов, детальные описания экранов, прогнозы результатов действий и многоэтапные сценарии использования приложений.

После завершения обучения ILuvUI продемонстрировала превосходство над базовой моделью LLaVA как в автоматизированных тестах, так и при оценке предпочтений реальными пользователями. Важным преимуществом системы является отсутствие необходимости указывать конкретную область интереса в интерфейсе — модель анализирует весь экран на основе простого текстового запроса.

Потенциальные применения технологии включают улучшение специальных возможностей для пользователей с ограниченными возможностями и автоматизированное тестирование пользовательских интерфейсов. Исследователи отмечают возможность дальнейшего совершенствования системы через использование более мощных кодировщиков изображений, улучшение обработки различных разрешений экрана и создание форматов вывода, совместимых с существующими фреймворками UI, такими как JSON.

Данная разработка дополняет недавнее исследование Apple о возможностях ИИ не только понимать, но и предсказывать последствия действий в приложениях, что открывает перспективы для создания более интеллектуальных систем взаимодействия с мобильными устройствами.

Источник: 9TO5Mac

Автор не входит в состав редакции iXBT.com (подробнее »)

0 комментариев

Добавить комментарий

Сейчас на главной

Новости

Публикации

Зачем в плотину Гувера уложили 936 километров стальных труб

Плотина Гувера выглядит как единая бетонная стена, выросшая между скалами Чёрного каньона. Однако во время строительства она больше напоминала гигантскую каменную кладку. Сооружение собирали из...

Актинидия, или северный киви: почему её ягоды почти не продают и стоит ли сажать эту лиану в саду

Название «северный киви» сначала показалось мне рекламной уловкой. Представлялся почти обычный киви, только растущий возле дачного забора и не боящийся русской зимы. Но под похожими названиями...

Курица гунбао: история острого блюда, которое родилось не в ресторане

Курица гунбао легко узнаётся по сочетанию, которое трудно спутать с другими блюдами китайской кухни: небольшие кусочки мяса, жареный арахис, сушёный перец и густой соус с одновременно сладким,...

Nakamichi Dragon (1982): зачем электроника системы NAAC непрерывно поворачивала воспроизводящую головку во время работы

В 1982 году японская компания Nakamichi представила кассетную деку Dragon по стартовой цене 1850 долларов (позже поднявшейся до $2499). Любители качественного звука отдавали такие суммы без...

Один в поле не видит: почему наше восприятие реальности ломается без других людей

Когда человек смотрит на окружающие предметы, ему кажется, что он получает прямое и чистое изображение реальности. Мы воспринимаем стены, деревья и окружающих людей как нечто само собой...