@rohanpaul_ai:来自 @markopolo_ai 新发布的 4B 参数模型 Athena 刚刚在预测购物者……方面击败了 GPT-5.6 和 Claude Opus 4.8

X AI KOLs Timeline 模型

摘要

Athena 是 markopolo_ai 对 Qwen3-4B 进行 LoRA 微调得到的 4B 参数模型,在 OPeRA 购物行为预测基准上击败了 GPT-5.6 和 Claude Opus 4.8,为预测购物者行为提供了一款可自行托管的专用模型。

来自 @markopolo_ai 新发布的 4B 参数模型 Athena 刚刚在预测购物者下一步行为方面击败了 GPT-5.6 和 Claude Opus 4.8! Athena 会观察购物者当前所在页面以及他们的交互历史,然后预测下一个浏览器动作。 例如,当购物者即将离开结账流程时,Athena 可以预测退出动作以及涉及的具体页面元素或导航步骤,甚至在此之前就能预判。 这可以让下游系统在购物者仍然活跃时有机会做出响应。 它在完整的 OPeRA 测试集(992 个动作)上取得了 24.50% 的严格精确匹配分数,是所有参赛系统中最高分。 严格精确匹配意味着预测要同时满足下一个动作和确切目标元素都正确;即使预测几乎正确,只要目标元素错了,得分也是零。这是一个庞大且毫不宽容的输出空间,而 Athena 仍然排名第一。 模型可在 Huggingface 上获取。 令人惊讶的是其规模,因为获胜者是对 Qwen3-4B 进行 LoRA 微调的结果,这是一个你可以自行托管的开放权重模型。 在此之前,要获得这样的预测,只能向尖端模型发出提示,寄希望于它能从一般推理中理解购物行为。 但这次发布意义重大,因为输入可能包含详细的浏览序列、页面状态、输入文本以及关于用户试图达成目标的信号。将所有信息发送给通用外部模型,在高事件量下可能不是理想选择,也可能过于昂贵。 一个紧凑、可自行托管的专用模型提供了一条更实用的路径。
查看原文
查看缓存全文

缓存时间: 2026/08/04 18:13

新发布的40亿参数模型Athena来自@markopolo_ai,刚刚在预测购物者下一步行为上击败了GPT-5.6和Claude Opus 4.8!

所以Athena会观察购物者当前所在的页面以及他们的交互历史,然后预测下一个浏览器动作。 例如,当购物者即将离开结账流程时,Athena可以预测退出动作以及涉及的具体页面元素或导航步骤,甚至在这些事情发生之前就做出预测。 这可以让下游系统在购物者仍然活跃时获得响应机会。

它在完整的OPeRA测试集(992个动作)上取得了24.50%的严格精确匹配分数,是所有参赛系统中最高的。

严格精确匹配意味着预测必须同时满足“下一个动作”和“精确目标元素”都正确才算数;即使目标元素错误,哪怕预测几乎正确,也只得零分。这是一个庞大且严苛的输出空间,而Athena仍然排名第一。

模型可在Huggingface上获取。 令人惊讶的是它的规模,因为获胜者是一个基于Qwen3-4B的LoRA微调模型,一个你可以自行部署的开源权重。

在此之前,要获得这样的预测,只能提示一个前沿模型,并寄希望于它能通过通用推理来理解购物行为。

但这次发布之所以意义重大,是因为输入可以包含详细的浏览序列、页面状态、键入文本,以及关于用户试图完成什么目标的信号。把所有这些都发送给一个通用的外部模型,在高事件量场景下可能不太可取,或者成本过高。

一个紧凑、可自行部署的专用模型提供了一条更实用的路径。

Tasbin (@ttasbin): 今天,我们发布了Athena(mvrko-sim-1),这是来自@markopolo_ai的旗舰Large Event Model,在OPeRa公开基准测试中击败了GPT-5.6、Claude Opus 4.8和Claude Sonnet 5,在购物行为预测任务上取得了第一!

Athena引入了一种完全不同的理解方式

相似文章

利用 GPT-4o mini 提升客户零售体验

OpenAI Blog

Zalando 与 OpenAI 合作,将其 AI 驱动的购物助手从 GPT-3.5 升级到 GPT-4o mini,实现了产品点击量增长 23%、愿望清单添加量增长 40% 以上,同时扩展到 25 个市场,并改进了多语言支持和指令遵循能力。