标签
OpenAI发布了GPT-5.6模型系列,包括Sol、Terra和Luna,这些模型在显著提升效率和降低成本的同时实现了前沿智能,背后是推理和智能体框架的创新。
蚂蚁集团旗下Robbyant开源了世界模型LingBot-World 2.0,支持连续运行一小时以上且画质不衰减,具备类大脑-小脑协同的agentic harness,支持多人同玩和多种交互动作,权重和代码已开源。
Crucible是一个开源判断引擎,它将一个论点转化为一组主张,通过对抗性测试为其构建最强反对论证,对照基底预言机进行衡量,并迭代优化最薄弱的轴,产生诸如MATCH、DRIFT或UNVERIFIABLE等裁决。
LingBot-World 2.0 是一个先进的世界模型,实现了无限制的交互范围、实时720p/60fps视频流、多样化的交互元素,以及一个集成了飞行员和导演智能体的智能体框架。该模型已在Hugging Face上发布,附带有推理代码和技术报告。
本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。
VS Code团队详细介绍了最近对GitHub Copilot代理功能的优化,例如提示缓存和工具搜索,以提高令牌效率并在基于用量的计费模式下降低成本。
Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。
GitHub 对自家 Copilot 的代理工具套件与模型供应商的工具套件进行了基准测试,发现在多个基准测试中,任务解决能力相当,但使用的 token 更少,突显了 Copilot 支持超过 20 个模型的特点。
Dirge是一个基于Rust的代理框架,通过减少内存占用并智能管理错误、上下文和工具调用,帮助较小的人工智能模型发挥超常表现,缩小与前沿模型的性能差距。
一篇关于递归语言模型(RLM)的教育性深度文章,解释了RLM是什么、为何它们能在长上下文基准测试中胜出,以及它们与现有智能体框架(如ReAct或CodeAct)的不同之处,并通过一个简单的案例研究进行说明。
HeavySkill 是一个新框架,通过并行推理和总结阶段,将复杂推理内化为模型的内在技能,其表现优于传统的编排方法,并通过强化学习实现了大语言模型的自我演进。