我搭建了一个竞技场,让LLM们在真实物理规则下进行剑斗。你来决定刀刃哪部分锋利,盲评胜负,免费OpenRouter模型争夺Elo排名。目前Llama 3.3正在刺向GPT-OSS的脸。
摘要
新竞技场让LLM控制物理布娃娃进行武器对决,用户定义武器伤害区域、盲评投票,模型争夺Elo排名。免费模型如Llama 3.3和GPT-OSS参与竞争,基础设施可自托管。
类似Chatbot Arena,但比较的不是文本墙,而是两个模型操控物理布娃娃进行武器对决——由你来设定武器规则。运作方式:
- 每回合,两个LLM获得战斗状态JSON(生命值、距离、对手上一招、上一回合命中部位),选择行动+步法
- 物理引擎执行:动量、关节限制、根据武器区域×冲击速度计算碰撞伤害。击中“活跃”区域的头部即秒杀
- 关键点:你选择哪些区域危险。仅剑尖模式迫使击剑;仅剑格模式迫使近战扭打;链锤尖刺只在高球速时有效,所以模型必须计划一个蓄力回合。规则放在系统提示中——策略由模型自己决定
- 盲评(战士A/B),投票后显示名称和Elo排名。每套规则有独立排行榜
截图来自一场真实比赛——蓝色方公告“攻击范围。将锋利区域对准他的头部”,然后一回合后恰好被这一招击中。免费模型(Llama 3.3 70B、GPT-OSS、Qwen3、Nemotron、Gemma)在名单上,所以你可以零成本运行比赛,或者粘贴任何OpenRouter ID。还有一种“关节模式”,让LLM直接控制所有10个关节,类似Toribash风格。当前模型……还不太擅长拥有身体。这很有趣。可在100%免费层自托管(HF Spaces + Vercel + Supabase)。锦标赛模式生成策略报告——攻击率、模型是否实际使用了锋利区域、每场对局的优势招式。(第一场比赛可能需要一分钟——免费HF Space正在唤醒。)
相似文章
我构建了一个2D物理竞技场,让LLM智能体在其中实时进行剑斗。结果发现,这出人意料地成为测试战术推理能力的绝佳方式。
Stickblade Arena 是一项新基准测试,让LLM智能体在2D物理刀剑格斗模拟器中控制布娃娃角色,测试其在对抗压力下的多回合战术推理、空间感知和实时决策能力。早期结果揭示了能力差距:DeepSeek R1在近战中占据主导地位,但因时间限制无法使用弓箭,而小模型在近距离战斗中表现出色。
我搭建了一个竞技场,让AI代理在实时3轮对战中互相厮杀——结果出乎意料
作者构建了AI Combat,这是一个平台,用户可以为AI代理设计特定角色和策略,让它们在实时3轮比赛中相互对战,配有AI裁判和ELO排名。
构建了一个轻量级Python框架,用于本地LLM角色扮演(Ollama/Phi-3),以防止上下文漂移。寻求反馈。
一个轻量级Python框架,使用Ollama和Phi-3进行本地LLM角色扮演,具有上下文保留和原生流式传输功能,防止角色漂移。
Built a Tauri v2 desktop chat shell for local LLMs — point it at Ollama / llama.cpp / any OpenAI-compatible endpoint, MIT, ~12 MB binary
Built a Tauri v2 desktop chat shell for local LLMs that can connect to Ollama, llama.cpp, or any OpenAI-compatible endpoint. The project is MIT licensed and produces a ~12 MB binary.
LM Arena 已经过时了吗?
一位用户批评 LM Arena 没有收录最近的开源模型(如 Qwen3.6 和 Step 3.7 Flash),质疑该平台在比较新开源模型与闭源模型方面的相关性。