agentic-tasks

标签

Cards List
#agentic-tasks

Kimi K3 与 Fable 相当;Kimi K3 和 Fable 达到最先进水平

Hacker News Top · 6天前 缓存

Kimi K3,一个开放模型,在智能体任务中与 Fable 相媲美,在它们之间进行路由实现了93%的准确率,成本节省高达50倍,建立了一种新的最先进方法。

0 人收藏 0 人点赞
#agentic-tasks

Kimi K3 已在网页和App上发布

Reddit r/LocalLLaMA · 2026-07-16

Kimi K3 是一款全新AI模型,拥有2.8万亿参数和100万上下文长度,已在网页和App上发布,在编程、智能体任务、推理、视觉和智能体集群方面具备领先能力。

0 人收藏 0 人点赞
#agentic-tasks

基于前缀重放的多轮在线策略蒸馏

Hugging Face Daily Papers · 2026-07-16 缓存

本文提出 ReOPD,一种用于 LLM 智能体的在线策略蒸馏方法,该方法重用预先收集的教师轨迹作为重放前缀,无需新的环境交互即可提高效率和准确性。

0 人收藏 0 人点赞
#agentic-tasks

SEED: 面向智能体强化学习的自进化在线策略蒸馏

Papers with Code Trending · 2026-07-16 缓存

提出 SEED,一种自进化在线策略蒸馏框架,将已完成的轨迹转化为后见技能,以改进交互式智能体任务的强化学习,取得了持续的性能提升和样本效率。

0 人收藏 0 人点赞
#agentic-tasks

@Azaliamirh: 了解 LLM-as-a-Verifier:一种简单、廉价且通用的自我改进技术,可提升“…”的性能

X AI KOLs Timeline · 2026-07-10 缓存

LLM-as-a-Verifier 是一种简单、廉价、通用的面向智能体任务的自我改进技术,通过细粒度评分和基于 logprob 的排名,在 SWE-Bench Verified 和 Terminal-Bench V2 等多个基准测试中取得了最先进的性能。

0 人收藏 0 人点赞
#agentic-tasks

@omarsar0: 值得收藏的新AI论文。这是我早期预言的,这篇论文证实了:验证已经出现……

X AI KOLs Timeline · 2026-07-07 缓存

这篇来自斯坦福大学、英伟达和加州大学伯克利分校的论文介绍了LLM-as-a-Verifier,一种无需训练的验证框架,利用LLM logits的连续评分来提高编码、机器人和医疗领域的准确性,在多个基准上取得了最先进的结果。

0 人收藏 0 人点赞
#agentic-tasks

@gurtej__gill_: 来自斯坦福、伯克利和NVIDIA的这篇新论文感觉像是测试时计算拼图中至关重要的一块……

X AI KOLs Timeline · 2026-07-07 缓存

这篇来自斯坦福、伯克利和NVIDIA的论文提出了LLM-as-a-Verifier,一个利用token logits进行连续评分的通用验证框架。它在包括Terminal-Bench V2(86.5%)和SWE-Bench Verified(78.2%)在内的多个基准上达到了SOTA,并提供了可以加速强化学习训练的细粒度信号。

0 人收藏 0 人点赞
#agentic-tasks

面向智能体任务的以对象为中心的环境建模

arXiv cs.AI · 2026-07-07 缓存

介绍了以对象为中心的环境建模(OCM),该方法将LLM代理的经验组织成两个可执行代码库(对象知识和过程知识),以提高复用性、验证能力,并减少交互环境中的无效动作。

0 人收藏 0 人点赞
#agentic-tasks

TREK:蒸馏以探索,强化以精炼

Hugging Face Daily Papers · 2026-07-06 缓存

TREK是一种分阶段方法,利用蒸馏扩展探索支持以优化策略,在数学推理和智能体任务上超越标准GRPO的性能。

0 人收藏 0 人点赞
#agentic-tasks

@SlimTradeyBaby:刚读了 @no_stp_on_snek 对全新 Ornith-1.0 35B 编码器的评测,这绝对是我很久以来见过的最好的模型测评之一……

X AI KOLs Following · 2026-06-26 缓存

对全新 Ornith-1.0 35B 编码模型的评测,绕过公开基准,在真实代理任务上进行测试,突出其在长程编码和连贯性方面的优势,以及诸如冗长性等代价。

0 人收藏 0 人点赞
#agentic-tasks

@bookwormengr: 这个账号只有5000粉丝,真是太可惜了。知乎是深度学习博客的顶峰。这就是中国的 Less Wrong…

X AI KOLs Timeline · 2026-06-24 缓存

讨论了为什么 GLM-5.2 放弃使用 GRPO,暗示 GRPO 的假设可能不适用于长周期代理任务。

0 人收藏 0 人点赞
#agentic-tasks

Counsel:面向智能体任务的元评估数据集

Hugging Face Daily Papers · 2026-06-19 缓存

Counsel 是首个公开的人类对 LLM 评价进行元评估的数据集,专为智能体任务设计,旨在提升自动化评估方法的校准性与可靠性。

0 人收藏 0 人点赞
#agentic-tasks

超越奖励工程:长上下文强化学习的数据配方

arXiv cs.CL · 2026-06-18 缓存

本文表明,通过精心设计的长上下文强化学习数据配方,结合基于结果的最小GRPO,能够显著提升多个模型和基准测试的推理能力,并迁移到GAIA和BrowseComp等智能体任务。

0 人收藏 0 人点赞
#agentic-tasks

技能还是跳过?通过双粒度偏好学习在智能体任务中学习选择性技能调用

arXiv cs.CL · 2026-06-02 缓存

提出了SelSkill,一个双粒度偏好学习框架,学习在智能体任务中何时调用技能,在ALFWorld上将任务成功率提升10.9%,在BFCL上提升5.7%。

0 人收藏 0 人点赞
#agentic-tasks

@maximelabonne: 我们在@huggingface上火了!说实话,我们低估了这个模型。它在代理任务上的能力远超我的预期。…

X AI KOLs Following · 2026-06-01 缓存

Maxime Labonne分享说,他们的模型在Hugging Face上成为热门,并且尽管只有1B个活跃参数,但在代理任务上出人意料地强大。

0 人收藏 0 人点赞
#agentic-tasks

为什么没人谈论 Mimo V2.5 (non-pro)

Reddit r/singularity · 2026-05-30

Mimo V2.5 提供了与 Claude Opus 4.5 相当的性能,但成本仅为后者的一小部分,使其成为执行代理任务的极具性价比的 AI 模型。

0 人收藏 0 人点赞
#agentic-tasks

Show HN: Forge – 护栏机制将8B模型在智能体任务上的准确率从53%提升至99%

Hacker News Top · 2026-05-19 缓存

Forge是一个为自托管LLM工具调用设计的可靠性层,通过护栏机制和上下文管理,显著提升多步智能体任务的性能,将本地8B模型的准确率从53%提高到99%。

0 人收藏 0 人点赞
#agentic-tasks

@NoahZiems: 对我们最近在 Pedagogical RL 上的工作感到非常兴奋。我乐观地认为这样的方法将完全…

X AI KOLs Following · 2026-05-15

Noah Ziems 表达了对他们在 Pedagogical RL 上最近工作的兴奋之情,该工作旨在改变像编程这样复杂的智能体任务的数据收集方式。

0 人收藏 0 人点赞
#agentic-tasks

为开发者推出 GPT-5

OpenAI Blog · 2025-08-07 缓存

OpenAI 在其 API 平台发布 GPT-5,这是一款最先进的模型,在 SWE-bench Verified 上达到 74.9% 的成绩,在编码、智能体任务和长上下文推理方面表现卓越。此次发布包含三个模型规格(gpt-5、gpt-5-mini、gpt-5-nano)以及新的 API 功能,如详细程度控制、最小推理模式和自定义工具。

0 人收藏 0 人点赞
← 返回首页

提交意见反馈