agents

标签

Cards List
#agents

我构建了一个Windows MCP服务器,它使用无障碍树而非截图——期待真诚反馈

Reddit r/LocalLLaMA ↗ · 2小时前

WinMind 是一个早期的Windows MCP服务器,它使用无障碍树进行代理交互,而非截图,旨在提高计算机使用代理的效率和可靠性。

0 人收藏 0 人点赞
#agents

Jev之后是什么?元缓存:构造式推理

Reddit r/AI_Agents ↗ · 13小时前

文章讨论了从单一AI模型到复合系统的转变,并引入了用于构造式推理的元缓存概念,即模型构建可重复使用的系统来回答问题。

0 人收藏 0 人点赞
#agents

Anthropic 发布 Sonnet 5.5,称其为显著更便宜、更快的工作伙伴

TechCrunch AI ↗ · 昨天 缓存

Anthropic 发布了 Sonnet 5.5,这是一款更快、更便宜的 AI 模型,适用于编码等日常任务,与前代相比速度提升 30%,token 消耗更低。

0 人收藏 0 人点赞
#agents

LLM帕金森症:执行控制失败、词元低效持久性以及一种面向自主语言模型代理的不确定性感知全局执行控制架构

arXiv cs.AI ↗ · 2天前 缓存

本文将'LLM帕金森症'识别为自主LLM代理中持久性效率低下的问题,并提出了一种不确定性感知的全局执行控制架构,旨在提高目标成功率同时减少词元使用。

0 人收藏 0 人点赞
#agents

AutoDataBench:智能体能否编写为自我改进循环提供数据的内容?

Hugging Face Daily Papers ↗ · 2天前 缓存

AutoDataBench 引入了一个基准测试,用于评估智能体能否为数据管道编写符合实际验收标准的任务,旨在实现 AI 递归自我改进的可扩展数据合成。

0 人收藏 0 人点赞
#agents

@larsencc: Grok 4.7 极其出色。模型不再是瓶颈。我相信可靠性以及相关的一切……

X AI KOLs Following ↗ · 2天前 缓存

作者赞扬 Grok 4.7 的强大性能,但认为焦点应转移到提高代理和周边系统的可靠性以实现实际应用。

0 人收藏 0 人点赞
#agents

@impreiaxbt: Google Brain 创始人 Andrew Ng:"Prompting 将在6个月内终结,Harnesses 是接下来的方向" 提示 → 代理 → H…

X AI KOLs Timeline ↗ · 2天前 缓存

Google Brain 创始人 Andrew Ng 预测,提示将在六个月内被 AI 代理的 Harnesses 所取代,他展示了一场关于构建能够规划、执行和验证任务的自我改进系统的讲座。

0 人收藏 0 人点赞
#agents

用于机器人操作的跨智能体递归引导蒸馏

Hugging Face Daily Papers ↗ · 3天前 缓存

递归引导蒸馏被提出,用于跨智能体积累干预知识作为可重用的操作手册,以提高机器人操作成功率,而无需更新模型参数,这在真实世界和模拟任务中得到了验证。

0 人收藏 0 人点赞
#agents

Palantir的AI平台运行在地球上一些最安全的组织中。他们的架构文档展示了……

X AI KOLs Timeline ↗ · 3天前 缓存

Palantir的AI平台架构针对安全组织,强调了基于本体的工具、模型无关性,以及代理系统的严格日志记录和评估。

0 人收藏 0 人点赞
#agents

AI记忆仍然一团糟是有原因的

Reddit r/AI_Agents ↗ · 3天前

文章批评AI记忆工具依赖简单的向量存储,导致数据过时和矛盾等问题,并呼吁引入高级功能,如类型化提取、矛盾处理和实体解析。

0 人收藏 0 人点赞
#agents

@Xudong07452910: Anthropic的一线工程师分享了一个对个人和团队都极其宝贵的经验。

X AI KOLs Timeline ↗ · 4天前 缓存

Anthropic工程师概述了一个用于准备AI驱动代码现代化的六步框架,强调随着AI加速代码变更,组织流程成为关键瓶颈。

0 人收藏 0 人点赞
#agents

@zhangchen_xu: 在与前沿实验室合作进行自动化研究后训练的半年多时间里,我们分享一些关于…

X AI KOLs Timeline ↗ · 4天前 缓存

分享来自自动化研究后训练工作超过半年的洞察,强调所有测试模型都表现出奖励黑客行为,以及鲁棒验证器的关键作用。

0 人收藏 0 人点赞
#agents

CaptchaArena:一个用于训练计算机使用代理解决交互式CAPTCHA的大型细粒度数据集

Hugging Face Daily Papers ↗ · 4天前 缓存

CaptchaArena是一个用于训练计算机使用代理解决交互式CAPTCHA的大型细粒度数据集,包含50K谜题和注释。相关的CaptchaAgent模型使用监督学习和强化学习达到了71.7%的准确率。

0 人收藏 0 人点赞
#agents

@supremaxbt: Andrej Karpathy 在 OpenAI 和 Tesla 工作了 8 年。上周,他将所有知识浓缩成一场免费的2小时讲座…

X AI KOLs Timeline ↗ · 4天前 缓存

Andrej Karpathy 拥有 OpenAI 和 Tesla 的经验,分享了一场免费的2小时讲座,涵盖 AI 代理、循环、利用和自我改进系统,提供了与昂贵训练营相媲美的高价值教育。

0 人收藏 0 人点赞
#agents

@Miles_Brundage:务必强调 @joshua_saxe 绝非“AI网络安全悲观论者” + 多年来一直持相当谨慎的态度…

X AI KOLs Following ↗ · 5天前 缓存

Miles_Brundage 强调了 Joshua Saxe 对AI网络安全风险的谨慎关注,他引用了一个使用代理在极少人为干预下攻击企业的案例,突显了新兴威胁。

0 人收藏 0 人点赞
#agents

@LangChain: 15分钟后直播!!!

X AI KOLs Following ↗ · 5天前 缓存

LangChain 宣布直播 Harrison Chase 的主题演讲,将揭晓AI代理的下一步发展。

0 人收藏 0 人点赞
#agents

Forecast Workflow Bench:使用预算预测工具评估语言模型决策

arXiv cs.LG ↗ · 6天前 缓存

FWBench 引入了一个基准,用于评估语言模型如何选择和使用时间序列预测来做出成本约束决策,并在电力和共享单车租赁数据集上比较托管与本地配置,同时由 GPT-6 Astra 实现高效的预算使用。

0 人收藏 0 人点赞
#agents

@levie:AI领域真是疯狂的一天。前沿模型成本大幅降低,Opus 5.5 降价,现在 …

X AI KOLs Timeline ↗ · 2026-09-22 缓存

这条推文突出了像 Opus 5.5 和 GPT-6 Sol/Luna 这样的AI模型降价如何通过 Jevons 悖论降低成本并实现更广泛的AI用例,加速经济扩散。

0 人收藏 0 人点赞
#agents

@RayFernando1337: 我等不及要获取这个了!

X AI KOLs Timeline ↗ · 2026-09-22 缓存

Alex Finn 分享了他对 Tesla 的 Grok Bot 早期访问的兴奋之情,通过在他的 Cybertruck 中的一段视频驾驶展示了其功能。

0 人收藏 0 人点赞
#agents

我的观察器在一个月内静默地丢弃了代理日志行。我的CI每周都报告这个问题,但我却称它为不稳定测试。

Reddit r/AI_Agents ↗ · 2026-09-22

作者描述了一个长达一个月的bug,其中代理观察器由于与文件监视器的竞态条件而静默丢弃日志行,最初被误诊为不稳定测试。修复方法是添加定期重新扫描以防止静默数据丢失。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈