标签
本文介绍了BatteryLake,一个治理型数据湖仓,它利用LLM智能体进行基于证据的元数据提取和模式映射,并采用人工在环验证,以策展异构电池老化数据集并发布开放基准测试。
Prime Intellect 发布了 verifiers v1 和 prime-rl 0.7.0,这是一个强化学习训练工具,完全支持 verifiers,包含多种算法如 GRPO 和 OPD,并进行了性能改进。
OpenProver 是一个开源系统,利用 Lean 4 进行 LLM 驱动的自动定理证明,采用规划器-工作器-验证器架构,并支持自主和交互两种模式。它实现了数学证明搜索中的可重复评估和人机协同。
一个35B参数的MoE模型,仅3B活跃参数,通过后训练强化学习匹配或超越100B级模型,实现显著效率提升。
MAD-OPD通过多教师辩论机制打破单教师蒸馏天花板,使小模型在工具调用和代码生成任务上反超大型教师模型。
Alexandr Wang 表示,Muse Spark 1.1 是一款具备行业竞争力的 Agentic 和编程模型,在多个评测中可与 GPT-5.5 和 Opus 4.8 抗衡,现可通过 Meta Model API 和 Meta AI 使用。
亚马逊宣布推出Alexa的智能代理版本,具备长期记忆功能,并整合了超过1000个应用,增强了其作为个人AI助手的能力。
Muse Spark 1.1 是 Meta 新推出的代理与编码模型,在 HealthBench-Pro 上提升了 5% 的性能,超越了除 Fable 和 Mythos 外的所有竞争对手。
Tess-4-27B 是一个基于 Qwen3.6-27B 构建的 27B 推理模型,在 64K 令牌长上下文智能体轨迹上进行了后训练,并采用了权重缩放推理。它旨在实现高效、诚实和智能体的任务执行,并以开源格式提供。
Meta 发布了 Muse Image,这是一个具有代理能力的图像生成模型,它能够进行规划、搜索网络、编写代码,并在渲染前进行编辑。
Meta推出了Muse Image并预览了Muse Video,这是一个具有代理能力的图像和视频生成系统,支持精确编辑、多参考源、与Instagram上下文集成,将媒体生成转变为完整的创意操作系统。
腾讯发布 Hy3,一个 295B MoE AI 模型,可与万亿级旗舰模型媲美,在 Apache 2.0 下开源,并提供免费 API 试用。
一项在经典中世纪欧洲奇幻角色扮演和代理型任务上对8个本地模型进行的基准测试发现,Qwen3.6-27B的表现比其参数规模所暗示的要好。
Anthropic 发布了 Claude Sonnet 5,这是迄今为止能力最强的 Sonnet 模型,具备改进的推理、编码和工具使用能力,并减少了幻觉现象。定价为每百万 tokens $2/$10,有效期至八月。
Anthropic 发布了 Claude Sonnet 5,改进了推理、工具使用和编码,但其更新的分词器将文本映射为更多令牌(最高1.35倍),尽管标价相同,但每个任务的实际成本增加;优惠价格适用至2026年8月31日。
NVIDIA 提出 HORIZON,一个自我进化的智能体框架,将硬件设计视为仓库级代码演化,在多个硬件设计套件上实现了100%的基准测试完成率。
Jon Udell 主张将 'human in the loop' 重新定义为 'human agent in the loop',即人类邀请AI代理进入协作过程,而非被机器驱动的循环所支配。
介绍一篇被PACT 2025接受的论文,提出了ComPilot框架,利用现成LLM作为优化代理,无需微调即可自动优化复杂循环嵌套,几何平均加速达3.54倍,超越SOTA Pluto。
认识 Gemma 4 12B Agentic Fable5,一个本地运行的 GGUF 模型,专为编码、终端任务和代理工作流设计,下载量已超 20.6 万次。