Fara-7B:一种高效的计算机使用智能体模型

Papers with Code Trending 论文

摘要

介绍了FaraGen——一种用于计算机使用智能体的合成数据生成系统,以及Fara-7B——一个体积小但效率高的模型,在网页任务基准测试中优于更大规模的模型。该模型已在Microsoft Foundry和HuggingFace上以开放权重形式发布。

计算机使用智能体(CUA)领域的发展一直受限于缺乏能够捕捉人类与计算机交互过程的大规模高质量数据集。虽然大语言模型(LLM)因丰富的文本数据而蓬勃发展,但CUA轨迹领域尚无类似的语料库。为解决这些问题,我们引入了FaraGen,一种用于多步骤网页任务的新型合成数据生成系统。FaraGen能够从常用网站中提出多样化任务,生成多个解决方案尝试,并使用多个验证器筛选成功轨迹。它在多步骤网页任务中实现了高吞吐量、高产出和高多样性,每个验证轨迹的成本约为1美元。我们利用这些数据训练了Fara-7B,一个原生CUA模型,它仅通过截图感知计算机,通过预测坐标执行操作,并且体积足够小,可以在设备端运行。我们发现,Fara-7B在WebVoyager、Online-Mind2Web以及我们新设计的WebTailBench等基准测试中,优于同等规模的其他CUA模型——WebTailBench能更好地涵盖之前基准测试中代表性不足的网页任务。此外,Fara-7B与更大规模的顶尖模型相比也颇具竞争力,这展示了可扩展数据生成系统在推动小型高效智能体模型发展方面的关键优势。我们将在Microsoft Foundry和HuggingFace上开放Fara-7B的权重,并发布WebTailBench。
查看原文
查看缓存全文

缓存时间: 2026/06/15 00:56

论文页面 - Fara-7B:一种高效的计算机使用智能体模型

来源:https://huggingface.co/papers/2511.19663 发布于 2025年11月24日

·

提交者https://huggingface.co/taesiri

taesiri (https://huggingface.co/taesiri)于 2025年11月26日

摘要

FaraGen 为计算机使用智能体创建合成数据集,使得能够训练出像 Fara-7B 这样在多样化网页任务上高效且性能卓越的模型,在基准测试中超越更大模型。

计算机使用智能体(CUA)的进展一直受限于缺乏大规模、高质量的数据集来捕捉人类与计算机交互的方式。虽然大型语言模型(LLM)因丰富的文本数据而蓬勃发展,但CUA轨迹(https://huggingface.co/papers?q=CUA%20trajectories)领域却没有类似的语料库。为弥补这些空白,我们引入了FaraGen(https://huggingface.co/papers?q=FaraGen),这是一种新颖的合成数据生成(https://huggingface.co/papers?q=synthetic%20data%20generation)系统,专用于多步骤网页任务(https://huggingface.co/papers?q=multi-step%20web%20tasks)。FaraGen(https://huggingface.co/papers?q=FaraGen)能从常用网站中提出多样化的任务,生成多次求解尝试,并利用多个验证器(https://huggingface.co/papers?q=verifiers)筛选成功的轨迹。它在多步骤网页任务(https://huggingface.co/papers?q=multi-step%20web%20tasks)上实现了高吞吐量、高产出率和多样性,每条经过验证的轨迹成本约为1美元。我们利用这些数据训练了Fara-7B(https://huggingface.co/papers?q=Fara-7B),这是一个原生CUA模型(https://huggingface.co/papers?q=native%20CUA%20model),仅凭截图(https://huggingface.co/papers?q=screenshots)感知计算机,通过预测坐标(https://huggingface.co/papers?q=predicted%20coordinates)执行操作,并且体积小到可以设备端运行。我们发现,Fara-7B(https://huggingface.co/papers?q=Fara-7B)在WebVoyager(https://huggingface.co/papers?q=WebVoyager)、Online-Mind2Web(https://huggingface.co/papers?q=Online-Mind2Web)和WebTailBench(https://huggingface.co/papers?q=WebTailBench)等基准测试中优于同等规模的其他CUA模型——WebTailBench是我们提出的新基准,能更好捕捉已有基准中代表性不足的网页任务。此外,Fara-7B(https://huggingface.co/papers?q=Fara-7B)与规模大得多的前沿模型相比也颇具竞争力,这展示了可扩展数据生成系统在推动小型高效智能体模型方面的关键优势。我们已在 Microsoft Foundry 和 HuggingFace 上开放了 Fara-7B(https://huggingface.co/papers?q=Fara-7B)的权重,并发布了WebTailBench(https://huggingface.co/papers?q=WebTailBench)。

查看arXiv页面 (https://arxiv.org/abs/2511.19663)查看PDF (https://arxiv.org/pdf/2511.19663)项目页面 (https://aka.ms/msaif/fara)GitHub5.53kauto (https://github.com/microsoft/fara)添加到收藏 (https://huggingface.co/login?next=%2Fpapers%2F2511.19663)

在你的智能体中获取本文:

hf papers read 2511.19663

没有最新的 CLI?curl -LsSf https://hf.co/cli/install.sh | bash

引用本论文的模型7个

microsoft/Fara-7B 图像-文本-文本• 8B• 更新于26天前 • 7.06k • 610 (https://huggingface.co/microsoft/Fara-7B)

AlexKitipov/Fara-7B 图像-文本-文本• 8B• 更新于15天前 • 16 • 1 (https://huggingface.co/AlexKitipov/Fara-7B)

XythicK/microsoft_Fara-7B-GGUF 图像-文本-文本• 8B• 更新于2025年12月26日 • 113 (https://huggingface.co/XythicK/microsoft_Fara-7B-GGUF)

Prince-1/Fara-7B-Onnx 图像-文本-文本• 更新于7天前 • 19 (https://huggingface.co/Prince-1/Fara-7B-Onnx)

浏览7个引用本论文的模型 (https://huggingface.co/models?other=arxiv:2511.19663)

引用本论文的数据集2个

microsoft/WebTailBench 预览• 更新于5月12日 • 291 • 16 (https://huggingface.co/datasets/microsoft/WebTailBench)

Archi-001/WebTailBench 预览• 更新于28天前 • 53 (https://huggingface.co/datasets/Archi-001/WebTailBench)

引用本论文的空间5个

收录本论文的合集2个

相似文章

microsoft/Fara-7B

Hugging Face Models Trending

微软发布了Fara-7B,这是一个高效的70亿参数智能小型语言模型(SLM),专为计算机使用任务设计,在其参数规模内实现了最先进的性能,并且与更大的系统相比具有竞争力。