Skip to content

Latest commit

 

History

History
255 lines (195 loc) · 10.4 KB

File metadata and controls

255 lines (195 loc) · 10.4 KB

UI-UX Logo

UI-UX

面向移动端用户体验的多模态大模型推理:
任务、基准与方法

English | 中文

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng,
Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

蚂蚁集团(Ant Group)

CVPR 2026 Findings Paper Model Demo License


摘要

用户体验(UX)以可用性、感知一致性与功能清晰度为核心,是真实世界用户界面(UI)的根本。 尽管多模态大语言模型(MLLM)已在视觉元素定位、GUI 智能体、设计到代码生成等 UI 任务上取得 进展,但其从界面截图中推理 UX 的能力仍鲜有研究:UX 缺陷往往源于设计惯例与用户心智模型 之间的错位,而非可见的布局错误。为此,我们提出首个面向 UX 缺陷诊断的视觉语言基准 UXBench, 以及通过强化学习增强、能够进行细粒度、以体验为中心推理的多模态模型 UI-UX。UI-UX 在 UXBench 上取得 79.63% 的准确率——在论文发表时超过当时的 Claude-4.5-Sonnet(65.50%),并在约半年后 仍领先最新的 Claude-Opus-4.8(72.90%)——同时保持了良好的跨任务泛化能力与较低的推理延迟。

目录


UI-* 系列

UI-UX 是蚂蚁集团面向用户界面的多模态模型系列之一:

项目 定位 链接
UI-UX (本仓库) UX 缺陷诊断与以体验为中心的推理;提出 UXBench 基准 论文 · 模型 · Demo
UI-UG 统一的 UI 理解(Understanding**)与生成(Generation)多模态模型:referring、grounding、captioning、generation 论文 · 仓库

亮点

  • UXBench —— 首个面向 UX 缺陷诊断的视觉语言基准:2,000 个 VQA 样本,覆盖 8 类任务、 3 个维度(可用性、效率、可信度)。
  • 8 类细粒度诊断任务 —— 每个任务都要求因果推理而非关键词匹配;标注经由 4 位资深 UX 专家 两轮校验。
  • 任务自适应奖励路由 + 非对称转移奖励 —— 基于 GRPO 的强化学习,在增强 UX 推理能力的同时 抑制过度思考、降低推理延迟。
  • 领先的实验结果 —— UI-UX 在 UXBench 上达到 79.63%,超过 Claude-4.5-Sonnet(65.50%), 并持续领先最新一代前沿 MLLM。

UXBench 8 Tasks
图 1. UXBench 覆盖 3 个维度下的 8 类 UX 缺陷诊断任务。


UXBench 基准

UXBench 是首个面向 UX 缺陷诊断的视觉语言基准,包含从真实移动端界面截图构建的 2,000 个 VQA 样本,组织为 3 个维度下的 8 类任务。每个样本均为二选一或三选一问题, 要求将视觉证据映射到设计原则进行因果推理,而非关键词匹配。标注通过大规模 MLLM 辅助生成, 并经过由 4 位资深 UX 专家进行的两轮校验,以保证标签一致性。

维度 任务 诊断的缺陷
可用性 Usability BubbleOcclT 浮层遮挡页面文本
可用性 Usability BubbleOcclBtn 浮层遮挡可点击元素
效率 Efficiency PopupNoClose 弹窗缺少明确的关闭控件
效率 Efficiency PopupBlock 弹窗遮挡原生 / 小程序关闭按钮
效率 Efficiency PopupStack 多个模态弹窗同时出现
可信度 Trustworthiness MismatchBadge 角标内容与落地页不一致
可信度 Trustworthiness MismatchContent 服务名称与页面文本不一致
可信度 Trustworthiness MismatchFunc 广告描述与实际功能不一致

每个任务以 $\boxed{X}$ 格式输出单个字母选项,便于确定性的精确匹配评分。


实验结果

UI-UX 仅以 4B 参数便在 UXBench 上取得最高准确率,超越了指令微调模型与推理模型—— 包括规模大两个数量级(235B)的模型以及领先的闭源系统。值得注意的是,UI-UX 将其同等规模的 基座模型 Qwen3-VL-Thinking(4B)从 0.5254 提升至 0.7963,提升超过 27 个百分点,这归功于 本文提出的强化学习框架。

Performance comparison on UXBench
图 2. 各模型在 UXBench 上的准确率对比(2,000 样本,8 类任务)。

论文中报告 UI-UX 达到 79.63%,超过 Claude-4.5-Sonnet(65.50%)。标注 的为论文发表后 (2026 年)补充评测的模型;UI-UX 仍领先于最新前沿模型,包括 Claude-Opus-4.8(0.7290)。


方法

UI-UX 是一个基于强化学习的增强框架,使用 GRPO 算法对多模态基座模型进行端到端微调, 无需人工偏好标注。其 UX 推理能力由两个机制驱动:任务自适应奖励路由,按任务类型选择合适的 奖励信号;以及非对称转移奖励,抑制冗余推理以降低延迟。

Training Pipeline
图 3. 训练流程:数据采集 → 标注 → 精选训练集 → 采用任务自适应奖励路由与非对称转移奖励的 GRPO 训练。

组成 细节
基座模型 Qwen3-VL-4B-Thinking(论文);本次发布将基座升级为 Qwen3.5-4B
优化方法 GRPO(SAPO loss)+ 任务自适应奖励路由
奖励设计 准确率 / ROUGE-L / 定位奖励 + 非对称转移奖励
参数量 4B
上下文长度 16K tokens
推理方式 通过 <think>...</think> 进行思维链推理,并以奖励抑制过度思考

完整的训练配置与奖励函数实现见 cookbook/


快速开始

安装

pip install -r requirements.txt

使用 Transformers 推理

from transformers import AutoModelForImageTextToText, AutoProcessor

model = AutoModelForImageTextToText.from_pretrained(
    "afx-team/UI-UX", dtype="auto", device_map="auto"
)
processor = AutoProcessor.from_pretrained("afx-team/UI-UX")

messages = [
    {
        "role": "user",
        "content": [
            {"type": "image", "image": "screenshot.png"},
            {"type": "text", "text": """Core Task: Evaluate whether the 'pop-up' offers users an explicit control for closing it.
Options:
A. No modal pop-up is present
B. The modal pop-up lacks an explicit close control
C. The modal pop-up has an explicit close control
Output Format: $\\boxed{X}$ (where X is one of A-C)."""},
        ],
    }
]

inputs = processor.apply_chat_template(
    messages, tokenize=True, add_generation_prompt=True,
    return_dict=True, return_tensors="pt"
).to(model.device)

output = model.generate(**inputs, max_new_tokens=8192)
response = processor.decode(output[0][len(inputs.input_ids[0]):], skip_special_tokens=True)
print(response)

使用 vLLM 推理(推荐)

vllm serve afx-team/UI-UX --port 8000 --max-model-len 16384 \
    --dtype bfloat16 --enable-reasoning --reasoning-parser deepseek_r1
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="dummy")
response = client.chat.completions.create(
    model="afx-team/UI-UX",
    messages=[{"role": "user", "content": [...]}],
    max_tokens=8192
)
print(response.choices[0].message.content)

更多完整示例(含 UXBench 批量评测)见 cookbook/


仓库结构

UI-UX/
├── assets/                 # Logo、图表
├── cookbook/               # 使用示例
│   ├── inference_transformers.py
│   ├── inference_vllm.py
│   ├── eval_uxbench.py
│   ├── serve_vllm.sh
│   └── README.md
├── .github/                # Issue / PR 模板
├── app.py                  # Gradio demo
├── README.md
├── requirements.txt
├── LEGAL.md
└── LICENSE

引用

如果 UXBench 或 UI-UX 对你的研究有帮助,请引用:

@inproceedings{uiux2026,
  title={Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach},
  author={Mao, Ruichao and Fang, Zhou and Guo, Teng and Yang, Hao and Li, Yaping and Peng, Shaohua and Huang, Maji and Lin, Xiaoyu and Liu, Shuoyang and Li, Xuepeng and Zhang, Yuyu and Rao, Hai},
  booktitle={CVPR Findings},
  year={2026}
}

许可证

本项目基于 MIT License 发布。关于模型与基准的附加条款,请参阅 LEGAL.md


致谢

UI-UX 基于 Qwen3-VL 构建,并使用 ms-swift 训练。感谢开源社区提供的这些基础工作。