agents

标签

Cards List
#agents

Anthropic 发布 Sonnet 5.5,称其为显著更便宜、更快的工作伙伴

TechCrunch AI ↗ · 17小时前 缓存

Anthropic 发布了 Sonnet 5.5,这是一款更快、更便宜的 AI 模型,适用于编码等日常任务,与前代相比速度提升 30%,token 消耗更低。

0 人收藏 0 人点赞
#agents

LLM帕金森症:执行控制失败、词元低效持久性以及一种面向自主语言模型代理的不确定性感知全局执行控制架构

arXiv cs.AI ↗ · 昨天 缓存

本文将'LLM帕金森症'识别为自主LLM代理中持久性效率低下的问题,并提出了一种不确定性感知的全局执行控制架构,旨在提高目标成功率同时减少词元使用。

0 人收藏 0 人点赞
#agents

@larsencc: Grok 4.7 极其出色。模型不再是瓶颈。我相信可靠性以及相关的一切……

X AI KOLs Following ↗ · 昨天 缓存

作者赞扬 Grok 4.7 的强大性能,但认为焦点应转移到提高代理和周边系统的可靠性以实现实际应用。

0 人收藏 0 人点赞
#agents

@impreiaxbt: Google Brain 创始人 Andrew Ng:"Prompting 将在6个月内终结,Harnesses 是接下来的方向" 提示 → 代理 → H…

X AI KOLs Timeline ↗ · 昨天 缓存

Google Brain 创始人 Andrew Ng 预测,提示将在六个月内被 AI 代理的 Harnesses 所取代,他展示了一场关于构建能够规划、执行和验证任务的自我改进系统的讲座。

0 人收藏 0 人点赞
#agents

Palantir的AI平台运行在地球上一些最安全的组织中。他们的架构文档展示了……

X AI KOLs Timeline ↗ · 2天前 缓存

Palantir的AI平台架构针对安全组织,强调了基于本体的工具、模型无关性,以及代理系统的严格日志记录和评估。

0 人收藏 0 人点赞
#agents

AI记忆仍然一团糟是有原因的

Reddit r/AI_Agents ↗ · 2天前

文章批评AI记忆工具依赖简单的向量存储,导致数据过时和矛盾等问题,并呼吁引入高级功能,如类型化提取、矛盾处理和实体解析。

0 人收藏 0 人点赞
#agents

@Xudong07452910: Anthropic的一线工程师分享了一个对个人和团队都极其宝贵的经验。

X AI KOLs Timeline ↗ · 3天前 缓存

Anthropic工程师概述了一个用于准备AI驱动代码现代化的六步框架,强调随着AI加速代码变更,组织流程成为关键瓶颈。

0 人收藏 0 人点赞
#agents

@zhangchen_xu: 在与前沿实验室合作进行自动化研究后训练的半年多时间里,我们分享一些关于…

X AI KOLs Timeline ↗ · 3天前 缓存

分享来自自动化研究后训练工作超过半年的洞察,强调所有测试模型都表现出奖励黑客行为,以及鲁棒验证器的关键作用。

0 人收藏 0 人点赞
#agents

@supremaxbt: Andrej Karpathy 在 OpenAI 和 Tesla 工作了 8 年。上周,他将所有知识浓缩成一场免费的2小时讲座…

X AI KOLs Timeline ↗ · 3天前 缓存

Andrej Karpathy 拥有 OpenAI 和 Tesla 的经验,分享了一场免费的2小时讲座,涵盖 AI 代理、循环、利用和自我改进系统,提供了与昂贵训练营相媲美的高价值教育。

0 人收藏 0 人点赞
#agents

@Miles_Brundage:务必强调 @joshua_saxe 绝非“AI网络安全悲观论者” + 多年来一直持相当谨慎的态度…

X AI KOLs Following ↗ · 4天前 缓存

Miles_Brundage 强调了 Joshua Saxe 对AI网络安全风险的谨慎关注,他引用了一个使用代理在极少人为干预下攻击企业的案例,突显了新兴威胁。

0 人收藏 0 人点赞
#agents

@LangChain: 15分钟后直播!!!

X AI KOLs Following ↗ · 4天前 缓存

LangChain 宣布直播 Harrison Chase 的主题演讲,将揭晓AI代理的下一步发展。

0 人收藏 0 人点赞
#agents

Forecast Workflow Bench:使用预算预测工具评估语言模型决策

arXiv cs.LG ↗ · 5天前 缓存

FWBench 引入了一个基准,用于评估语言模型如何选择和使用时间序列预测来做出成本约束决策,并在电力和共享单车租赁数据集上比较托管与本地配置,同时由 GPT-6 Astra 实现高效的预算使用。

0 人收藏 0 人点赞
#agents

@levie:AI领域真是疯狂的一天。前沿模型成本大幅降低,Opus 5.5 降价,现在 …

X AI KOLs Timeline ↗ · 6天前 缓存

这条推文突出了像 Opus 5.5 和 GPT-6 Sol/Luna 这样的AI模型降价如何通过 Jevons 悖论降低成本并实现更广泛的AI用例,加速经济扩散。

0 人收藏 0 人点赞
#agents

@RayFernando1337: 我等不及要获取这个了!

X AI KOLs Timeline ↗ · 6天前 缓存

Alex Finn 分享了他对 Tesla 的 Grok Bot 早期访问的兴奋之情,通过在他的 Cybertruck 中的一段视频驾驶展示了其功能。

0 人收藏 0 人点赞
#agents

我的观察器在一个月内静默地丢弃了代理日志行。我的CI每周都报告这个问题,但我却称它为不稳定测试。

Reddit r/AI_Agents ↗ · 2026-09-22

作者描述了一个长达一个月的bug,其中代理观察器由于与文件监视器的竞态条件而静默丢弃日志行,最初被误诊为不稳定测试。修复方法是添加定期重新扫描以防止静默数据丢失。

0 人收藏 0 人点赞
#agents

@10xmylife: Qianwen Office的离线论坛超级火爆 太夸张了 通常,大多数我接触的人…

X AI KOLs Timeline ↗ · 2026-09-22 缓存

文章描述了Qianwen Office离线论坛的流行程度,突显了科技开发者与教育培训等行业从业者在AI工具采用方面的差距,这些行业正日益使用工具来提高效率。

0 人收藏 0 人点赞
#agents

SFT与RL的精妙配比:当强化学习赋能长期广告代理

arXiv cs.LG ↗ · 2026-09-22 缓存

本文提出了一种平衡监督微调和强化学习的方法,用于训练长期广告代理,表明定向RL可以减少数据泄露,并提升企业分析任务的性能。

0 人收藏 0 人点赞
#agents

@FinanceYF5: Meta的Muse被质疑为"大众版的OpenClaw"。有人提示Muse进行自我检查,发现它u…

X AI KOLs Following ↗ · 2026-09-22

Meta的Muse因与OpenClaw相似而受到批评,Nat Friedman承认受到了启发,但表示它是从零开始构建的,旨在为更广泛的用途增强个人智能体。

0 人收藏 0 人点赞
#agents

@FinanceYF5: Anthropic 公开披露了他们距离递归自我改进有多近:Claude 领导了 26% 的研发任务,不足……

X AI KOLs Timeline ↗ · 2026-09-21

Anthropic 披露,Claude 领导了 26% 的研发任务,参与度超过 90%,涉及 30,000 个智能体进行持续研发,并详细说明了重要的决策量和监控流程。

0 人收藏 0 人点赞
#agents

onPanda:通过令牌级修正实现大语言模型与智能体在线策略对齐数据的高效标注

Hugging Face Daily Papers ↗ · 2026-09-21 缓存

onPanda是一个交互式工具,使用令牌级修正来高效标注大语言模型对齐数据和智能体轨迹,将中位数标注时间减少了52%。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈