@rohanpaul_ai:来自 @markopolo_ai 新发布的 4B 参数模型 Athena 刚刚在预测购物者……方面击败了 GPT-5.6 和 Claude Opus 4.8
摘要
Athena 是 markopolo_ai 对 Qwen3-4B 进行 LoRA 微调得到的 4B 参数模型,在 OPeRA 购物行为预测基准上击败了 GPT-5.6 和 Claude Opus 4.8,为预测购物者行为提供了一款可自行托管的专用模型。
查看缓存全文
缓存时间: 2026/08/04 18:13
新发布的40亿参数模型Athena来自@markopolo_ai,刚刚在预测购物者下一步行为上击败了GPT-5.6和Claude Opus 4.8!
所以Athena会观察购物者当前所在的页面以及他们的交互历史,然后预测下一个浏览器动作。 例如,当购物者即将离开结账流程时,Athena可以预测退出动作以及涉及的具体页面元素或导航步骤,甚至在这些事情发生之前就做出预测。 这可以让下游系统在购物者仍然活跃时获得响应机会。
它在完整的OPeRA测试集(992个动作)上取得了24.50%的严格精确匹配分数,是所有参赛系统中最高的。
严格精确匹配意味着预测必须同时满足“下一个动作”和“精确目标元素”都正确才算数;即使目标元素错误,哪怕预测几乎正确,也只得零分。这是一个庞大且严苛的输出空间,而Athena仍然排名第一。
模型可在Huggingface上获取。 令人惊讶的是它的规模,因为获胜者是一个基于Qwen3-4B的LoRA微调模型,一个你可以自行部署的开源权重。
在此之前,要获得这样的预测,只能提示一个前沿模型,并寄希望于它能通过通用推理来理解购物行为。
但这次发布之所以意义重大,是因为输入可以包含详细的浏览序列、页面状态、键入文本,以及关于用户试图完成什么目标的信号。把所有这些都发送给一个通用的外部模型,在高事件量场景下可能不太可取,或者成本过高。
一个紧凑、可自行部署的专用模型提供了一条更实用的路径。
Tasbin (@ttasbin): 今天,我们发布了Athena(mvrko-sim-1),这是来自@markopolo_ai的旗舰Large Event Model,在OPeRa公开基准测试中击败了GPT-5.6、Claude Opus 4.8和Claude Sonnet 5,在购物行为预测任务上取得了第一!
Athena引入了一种完全不同的理解方式
相似文章
@rohanpaul_ai: 一个专为单一领域构建的小型模型,能否击败体积是其100倍的前沿通用模型?最近一篇论文显示……
PolyAI的Raven 3.5是一款较小的专业模型,在延迟低于300毫秒的情况下,在所有客户服务基准测试中超越了GPT-5和Claude Sonnet 4.6。该公司还推出了ADK和PolyPhone,以加速企业级语音AI部署。
利用 GPT-4o mini 提升客户零售体验
Zalando 与 OpenAI 合作,将其 AI 驱动的购物助手从 GPT-3.5 升级到 GPT-4o mini,实现了产品点击量增长 23%、愿望清单添加量增长 40% 以上,同时扩展到 25 个市场,并改进了多语言支持和指令遵循能力。
'一刀切'式AI时代已终结。我实测了GPT-5.5、Claude 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro——以下是最新前沿格局。
对GPT-5.5、Claude Opus 4.7、Gemini 3.1 Pro和DeepSeek V4 Pro的基准测试分析表明,没有单一模型在所有任务上占据优势;要实现最佳性能,需要采用多模型路由器,根据各模型的优势与弱点进行专门化使用。
@aaron_epstein: 新发布的模型在OCR、视觉和STT任务上击败了sonnet 4.6、gemini 3 flash和gpt 5.4 mini @interfaze_ai
来自interfaze_ai的新AI模型声称在OCR、视觉和语音转文字任务上超越领先模型(sonnet 4.6、gemini 3 flash、gpt 5.4 mini)。
AI周报(2026年5月23–30日):Claude Opus 4.8 Fast模式降价3倍,Qwen 3.7 Max半价超越Claude,ChatGPT入驻Excel
2026年5月23–30日主要AI发布综合盘点,涵盖Claude Opus 4.8 Fast模式降价、Qwen 3.7 Max竞争性定价发布、ChatGPT集成Excel、Gemini 3.5 Flash、Grok Build 0.1、Mistral的Vibe智能体以及Hugging Face机器人应用商店,并分析了推理成本下降趋势及战场转向分发领域。