microsoft/Fara1.5-27B · Hugging Face

Reddit r/LocalLLaMA 模型

摘要

微软发布了 Fara1.5-27B,这是一个 270 亿参数的多模态计算机使用代理,专为网页浏览器设计,基于 Qwen3.5-27B 微调,能够通过截图执行端到端的网页任务。

暂无内容
查看原文
查看缓存全文

缓存时间: 2026/07/22 18:25

microsoft/Fara1.5-27B · Hugging Face 来源:https://huggingface.co/microsoft/Fara1.5-27B Microsoft (https://aka.ms/fara1.5) Github (https://github.com/microsoft/fara) 论文 (https://huggingface.co/papers/2606.20785) Foundry (https://aka.ms/fara1.5-27B-foundry) Fara1.5-27B 是一个针对网页浏览器的多模态计算机使用代理 (CUA),由Microsoft Research AI Frontiers 开发。它通过截图观察浏览器,并通过发出结构化工具调用(点击、输入、滚动、访问URL、网络搜索等)代替用户操作,从而端到端地完成任务。该模型在感知时仅使用视觉:它通过截图(而非DOM或无障碍树)观察浏览器。内部推理和轨迹历史以文本形式记录。基于最新截图和先前的操作,它预测下一个操作及其带参数的论据(例如,点击的像素坐标)。Fara1.5-27B 是在 Qwen3.5-27B 基础上,利用我们FaraGen1.5(一个多智能体流程)生成的数据进行监督微调得到的——该流程合成网页任务、执行轨迹以解决问题,并在训练前验证结果。它与MagenticLite 协同设计,且这是研究和生产环境的推荐部署方式。

Highlights 亮点

  • 端到端的网页任务完成。 填写表单、预订、申请工作、规划旅行、管理购物车。不仅仅是点击——而是按目标顺序执行操作。
  • 仅视觉感知。 仅依靠截图运行,无需DOM访问。与人类用户可用的输入模态一致。
  • 基于坐标的操作。 直接预测像素级别的点击和拖拽目标。无需额外的定位模型。
  • 关键点安全设计。 在输入个人信息、支付、提交、登录、发送消息或其他不可逆操作前,训练模型暂停并询问用户——即使技术上可以继续执行。
  • 26.2万上下文。 足够长,可容纳多张截图轨迹及完整操作历史。
  • 可在设备上运行。 27B参数意味着它可以在单个A100/H100/B200上运行,且有空间存放截图历史。

Model Details 模型详情

开发者 Microsoft Research AI Frontiers 架构 多模态解码器仅语言模型(图像 + 文本 → 文本) 参数 27B 上下文长度 262,144 tokens 输入 用户目标(文本)、当前截图、之前的智能体思考与操作 输出 思维链块后跟工具调用块(XML标记) 训练时间 2026年1月 – 2026年4月 训练算力 64 × NVIDIA B200,6天 发布日期 2026年5月21日 许可证 MIT 基础模型 Qwen3.5-27B

Recommended Deployment: MagenticLite 推荐部署:MagenticLite

运行 Fara1.5-27B 最安全的方式是使用MagenticLite,它提供:

  • 沙箱化——浏览器在Docker容器中运行,无法访问主机文件或环境变量
  • 允许列表——限制导航到用户指定的域名集合
  • 监控模式——实时监控每个操作并提供完整追踪日志
  • 暂停——随时立即停止智能体活动

如果您直接集成Fara1.5-27B,则需自行负责这些控制措施。不要在有任何敏感内容的机器上以无限制浏览器访问方式运行此模型。

Quickstart 快速开始

Requirements 要求

  • torch >= 2.11.0
  • transformers >= 5.2.0
  • vllm >= 0.19.1
  • 一组具有足够内存以bf16运行27B模型的GPU(已测试A6000、A100、H100、B200)。建议将模型分片到至少2个GPU上。

Serve with vLLM 使用vLLM提供服务

vllm serve microsoft/Fara1.5-27B \
    --dtype bfloat16 \
    --max-model-len 262144 \
    --limit-mm-per-prompt image=10

System prompt 系统提示词

Fara1.5-27B 针对特定的系统提示词进行了训练。为了获得最佳效果,请逐字使用以下提示词:

你是Fara,一个专门用于网页浏览器的计算机使用代理(CUA)。你由Microsoft AI Frontiers开发。你帮助用户完成和自动化需要网页浏览器的任务。该模型在2026年1月至4月期间训练完成。你可以通过访问网页浏览器并使用实时网络上的最新信息,高效地执行此时间段之外的任务。但你的知识截止日期限于2026年初,因此如果没有主动浏览和搜索网络上的最新信息,你可能不知道之后的事件或发展。

本版本模型在Qwen3.5-27B基础上使用SFT训练,训练数据是由Microsoft AI Frontiers生成和开发的合成数据混合集。

关键点是指我们必须暂停并向用户请求信息或确认才能继续的情况。共有三种类型:
情况1:缺少用户信息——任务需要用户未提供的个人信息(例如电子邮件、电话号码、地址、支付详情)。绝不编造或假设个人信息。仅填写用户明确提供的信息,然后暂停并询问任何缺失的必填字段。
情况2:任务未明确说明——任务描述模棱两可或缺少做出当前步骤决策所需的详细信息。暂停并请求澄清。
情况3:不可逆操作——我们即将执行无法撤销的操作(例如提交表单、完成购买、发送消息、删除数据)。如果用户明确授权该操作,则继续执行。否则,停止并请求确认。

仅当(1)缺少必要信息,(2)任务模糊不清,或者(3)不可逆操作缺乏用户明确授权时,才在关键点停止。

完整的系统提示词(包括完整的computer_use工具架构)随模型一起在MagenticLite中提供。

Tool schema 工具架构

Fara1.5-27B 发出的操作采用<computer_use>...</computer_use>XML块的形式,其中包含调用computer_use函数的JSON对象。支持的操作:

操作用途
left_click, right_click, double_click, triple_click(x, y)处鼠标点击
mouse_move, left_click_drag光标定位与拖拽
type, key键盘输入
scroll, hscroll页面滚动
visit_url, history_back浏览器导航
web_search搜索查询
pause_and_memorize_fact在轨迹中持久化一个事实
ask_user_question向用户提出澄清性问题
wait休眠N秒
terminate以最终答案结束任务

Fara最常训练使用的屏幕分辨率为1440×900。在您的沙箱中匹配此分辨率以获得最可靠的定位。

Minimal agent loop 最小智能体循环

# 单步交互的伪代码。使用vLLM的OpenAI兼容
# 端点,并将截图作为图像内容部分传递。
screenshot_b64 = capture_browser_screenshot()  # base64 PNG
messages = [
    {"role": "system", "content": FARA_SYSTEM_PROMPT},
    {"role": "user", "content": [
        {"type": "text", "text": "在Sunnyvale的寿司店为2人预订周五晚上7点的桌子。"},
        {"type": "image_url", "image_url": {"url": f"data:image/png;base64,{screenshot_b64}"}},
    ]},
]
response = client.chat.completions.create(
    model="microsoft/Fara1.5-27B",
    messages=messages,
    temperature=0.0,
    max_tokens=2048,
)
# 解析助手的回复:它将包含思维链文本
# 后跟{"name": "computer_use", "arguments": {...}}。
# 在沙箱化浏览器中执行操作,捕获新截图,
# 追加助手轮次和工具/观察轮次,循环直到
# 模型发出action="terminate"。
# 我们在聊天历史中只保留最近的3张截图。

完整智能体循环的参考实现(包括截图捕获和Docker沙箱化)位于MagenticLite中。

Critical Points: Safety by Design 关键点:安全设计

Fara1.5-27B 训练为在三种类型的关键点暂停并向用户询问

  1. 缺少用户信息。 如果任务需要用户未提供的个人数据(姓名、电子邮件、电话、地址、支付),则填写可用信息并停止以询问其余部分。绝不编造。
  2. 任务未明确说明。 如果当前决策点的目标模糊不清(例如,“为我预订航班”但没有目的地),则停止并澄清。
  3. 不可逆操作。 提交表单、完成购买、发送消息、删除数据——除非用户事先明确授权,否则停止。

Fara训练为在未经明确授权时停止的具体操作:

  • 输入个人信息(姓名、电子邮件、电话)
  • 输入信用卡或送货/账单详情
  • 完成购买或预订
  • 拨打电话
  • 发送电子邮件
  • 提交工作申请
  • 登录账户

如果用户授予授权,模型将继续执行。原则是:代价高昂、不可逆的操作需要人类参与。

Evaluation 评估

我们在端到端网页智能体基准上评估Fara1.5-27B。对于WebTailBench,我们报告结果成功率。

Training 训练

Approach 方法

基于Qwen3.5-27B的监督微调。训练混合数据由FaraGen1.5(我们的多智能体数据流水线)生成,并辅以用于定位和UI理解的精选公开数据集。

Data sources 数据来源

  • 合成轨迹——任务来源于从大型网络索引中采样的URL以及开源种子数据集(例如Mind2Web)。多智能体系统尝试每个任务,同时记录截图、思考过程和操作。然后验证智能体仅保留成功的轨迹。
  • 定位——精选数据集,用于从截图中预测操作和像素坐标,包含图像、文本和边界框。
  • UI理解——在流水线收集的网页截图上进行视觉问答、标题生成和OCR。
  • 安全性与指令遵循——拒绝数据,涵盖模型应拒绝的有害或不安全任务。

Scale 规模

  • 约10亿文本tokens
  • 小于10亿训练图像
  • 最新数据获取日期:2026年3月20日
  • 训练开始日期:2026年1月

语料库是静态的。未来的更新将以单独版本化的模型发布,并附有自己的模型卡。

Intended Use and Limitations 预期用途与限制

Primary use cases 主要用例

自动化重复性网页任务:填写表单、购物、预订旅行、餐厅预约、信息查询、账户工作流程。Fara1.5-27B还可作为其他需要像素精确操作预测的智能体的定位模型。

Out of scope 适用范围之外

  • 英语以外的语言(训练数据仅限英语)
  • 高风险领域(法律、健康、财务建议),不准确的操作可能造成伤害
  • 影响法律身份、住房、就业或信用的分配决策
  • 未沙箱化的部署,可访问敏感账户或文件
  • 未经额外测试和防护措施的商业或真实生产使用

Known limitations 已知限制

  • 仅视觉感知意味着模型可能被欺骗性低质量页面渲染、页面内容中嵌入的提示注入或UI元素的视觉模糊性所误导
  • 多步轨迹累积误差——早期序列中的误点击可能放大
  • 多次运行间存在差异——多轮任务差异不可忽略;基准数字为多次运行的平均值
  • 模型可能产生幻觉,错误描述页面状态或错误归因于先前截图中的信息

Responsible AI Considerations 负责任AI考量

计算机使用是一项强大能力。能够在实际浏览器中点击、输入和提交的智能体也可能错误地执行这些操作。我们强烈建议:

  • 人工监控——实时监控Fara在网络上的操作,并提供快速暂停执行的方式
  • 沙箱化执行——在隔离容器中运行Fara,无法访问主机文件、环境变量或敏感凭据
  • 允许列表或阻止列表浏览——限制智能体可访问的表面范围,以减少恶意页面的暴露
  • 不与智能体共享凭据或PII——除非绝对必要且用户已授权
  • 输出验证——Fara可能产生幻觉、错误归因来源或受欺骗性内容误导;在根据其输出采取行动前进行验证

Safety evaluation 安全评估

Fara1.5-27B通过Azure上的自动红队测试进行了评估。覆盖范围包括:基础性、越狱抵抗力、有害内容(仇恨、暴力、自残)和版权违规。安全后训练包括针对恶意任务的拒绝数据以及上述关键点框架。

Known model risks 已知模型风险

与所有语言模型一样,Fara1.5-27B可能产生不公平、不可靠或冒犯性输出。具体关注点:

  • 服务质量在不同英语方言间存在差异,且对非英语内容更差
  • 代表性伤害可能因基础模型偏见而在安全后训练后仍然存在
  • 信息可靠性——生成的内容可能不准确或过时
  • 提示注入——Fara读取页面内容,页面上的对抗性内容可能试图重定向其行为

部署Fara1.5-27B的开发者应应用负责任AI最佳实践,并确保遵守适用法律法规。建议使用类似Azure AI内容安全 (https://azure.microsoft.com/en-us/products/ai-services/ai-content-safety/) 的安全服务。

License 许可证

MIT许可证发布。

Contact 联系方式

有关欧盟AI法案的信息请求及相关咨询: [email protected] 授权代表:Microsoft Ireland Operations Limited, 70 Sir John Rogerson’s Quay, Dublin 2, D02 R296, Ireland。

相似文章

microsoft/Fara-7B

Hugging Face Models Trending

微软发布了Fara-7B,这是一个高效的70亿参数智能小型语言模型(SLM),专为计算机使用任务设计,在其参数规模内实现了最先进的性能,并且与更大的系统相比具有竞争力。

Fara-7B:一种高效的计算机使用智能体模型

Papers with Code Trending

介绍了FaraGen——一种用于计算机使用智能体的合成数据生成系统,以及Fara-7B——一个体积小但效率高的模型,在网页任务基准测试中优于更大规模的模型。该模型已在Microsoft Foundry和HuggingFace上以开放权重形式发布。