agentic-harness

标签

Cards List
#agentic-harness

GPT-5.6如何融合前沿智能与前沿效率

OpenAI Blog · 昨天 缓存

OpenAI发布了GPT-5.6模型系列,包括Sol、Terra和Luna,这些模型在显著提升效率和降低成本的同时实现了前沿智能,背后是推理和智能体框架的创新。

0 人收藏 0 人点赞
#agentic-harness

@aigclink: 蚂蚁集团旗下具身智能公司 Robbyant 开源了世界模型 LingBot-World 2.0——能连续跑一个多小时、画质未见明显可见衰减,还内置一套类大脑-小脑协同的 agentic harness,让世界随用户动作持续展开。 原有世界…

X AI KOLs Timeline · 2026-07-10 缓存

蚂蚁集团旗下Robbyant开源了世界模型LingBot-World 2.0,支持连续运行一小时以上且画质不衰减,具备类大脑-小脑协同的agentic harness,支持多人同玩和多种交互动作,权重和代码已开源。

0 人收藏 0 人点赞
#agentic-harness

Crucible。一个判断引擎:注册一个论点,为每个主张构建最强反对论证,对照基底进行衡量,优化最薄弱的轴。

Reddit r/artificial · 2026-07-08

Crucible是一个开源判断引擎,它将一个论点转化为一组主张,通过对抗性测试为其构建最强反对论证,对照基底预言机进行衡量,并迭代优化最薄弱的轴,产生诸如MATCH、DRIFT或UNVERIFIABLE等裁决。

0 人收藏 0 人点赞
#agentic-harness

robbyant/lingbot-world-v2-14b-causal-fast

Hugging Face Models Trending · 2026-07-08 缓存

LingBot-World 2.0 是一个先进的世界模型,实现了无限制的交互范围、实时720p/60fps视频流、多样化的交互元素,以及一个集成了飞行员和导演智能体的智能体框架。该模型已在Hugging Face上发布,附带有推理代码和技术报告。

0 人收藏 0 人点赞
#agentic-harness

无限世界与多样交互

Hugging Face Daily Papers · 2026-07-08 缓存

本文介绍了LingBot-World 2.0,一个先进的世界建模系统,具有无界交互范围、实时720p 60fps视频生成、多样化的交互元素(例如攻击、施法),以及通过领航员和导演智能体实现的新型多智能体行为控制,还附带一个共享的多玩家界面。

0 人收藏 0 人点赞
#agentic-harness

提升VS Code中GitHub Copilot的令牌效率

Lobsters Hottest · 2026-07-02 缓存

VS Code团队详细介绍了最近对GitHub Copilot代理功能的优化,例如提示缓存和工具搜索,以提高令牌效率并在基于用量的计费模式下降低成本。

0 人收藏 0 人点赞
#agentic-harness

@sethkarten: https://x.com/sethkarten/status/2072034978112889328

X AI KOLs Following · 2026-06-30 缓存

Continual Harness 是一种无需重置、自我改进的智能体框架,通过存储记忆、复用技能和优化提示,在 ARC-AGI-3 上以 774 美元的成本达到了 20.54% 的准确率,以更高的效率超越了 Hermes 和 OpenClaw 等先前基准。

0 人收藏 0 人点赞
#agentic-harness

GitHub:我们将 GitHub Copilot 的代理工具套件与原生搭载领先模型的工具套件进行了基准测试。在保持…

X AI KOLs Following · 2026-06-28 缓存

GitHub 对自家 Copilot 的代理工具套件与模型供应商的工具套件进行了基准测试,发现在多个基准测试中,任务解决能力相当,但使用的 token 更少,突显了 Copilot 支持超过 20 个模型的特点。

0 人收藏 0 人点赞
#agentic-harness

借助智能Rust框架,让预算模型发挥超常表现

Lobsters Hottest · 2026-06-17 缓存

Dirge是一个基于Rust的代理框架,通过减少内存占用并智能管理错误、上下文和工具调用,帮助较小的人工智能模型发挥超常表现,缩小与前沿模型的性能差距。

0 人收藏 0 人点赞
#agentic-harness

@TDataScience:跟随@neural_avb的全方位深度解析,了解“递归语言模型(RLM)是什么、为何它们会在长上下文基准测试中持续胜出……”

X AI KOLs Following · 2026-05-23 缓存

一篇关于递归语言模型(RLM)的教育性深度文章,解释了RLM是什么、为何它们能在长上下文基准测试中胜出,以及它们与现有智能体框架(如ReAct或CodeAct)的不同之处,并通过一个简单的案例研究进行说明。

0 人收藏 0 人点赞
#agentic-harness

HeavySkill:作为智能体驾驭内在技能的深度思考

Papers with Code Trending · 2026-05-04 缓存

HeavySkill 是一个新框架,通过并行推理和总结阶段,将复杂推理内化为模型的内在技能,其表现优于传统的编排方法,并通过强化学习实现了大语言模型的自我演进。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈