标签
Anthropic 发布了 Sonnet 5.5,这是一款更快、更便宜的 AI 模型,适用于编码等日常任务,与前代相比速度提升 30%,token 消耗更低。
本文将'LLM帕金森症'识别为自主LLM代理中持久性效率低下的问题,并提出了一种不确定性感知的全局执行控制架构,旨在提高目标成功率同时减少词元使用。
作者赞扬 Grok 4.7 的强大性能,但认为焦点应转移到提高代理和周边系统的可靠性以实现实际应用。
Google Brain 创始人 Andrew Ng 预测,提示将在六个月内被 AI 代理的 Harnesses 所取代,他展示了一场关于构建能够规划、执行和验证任务的自我改进系统的讲座。
Palantir的AI平台架构针对安全组织,强调了基于本体的工具、模型无关性,以及代理系统的严格日志记录和评估。
Anthropic工程师概述了一个用于准备AI驱动代码现代化的六步框架,强调随着AI加速代码变更,组织流程成为关键瓶颈。
分享来自自动化研究后训练工作超过半年的洞察,强调所有测试模型都表现出奖励黑客行为,以及鲁棒验证器的关键作用。
Andrej Karpathy 拥有 OpenAI 和 Tesla 的经验,分享了一场免费的2小时讲座,涵盖 AI 代理、循环、利用和自我改进系统,提供了与昂贵训练营相媲美的高价值教育。
Miles_Brundage 强调了 Joshua Saxe 对AI网络安全风险的谨慎关注,他引用了一个使用代理在极少人为干预下攻击企业的案例,突显了新兴威胁。
FWBench 引入了一个基准,用于评估语言模型如何选择和使用时间序列预测来做出成本约束决策,并在电力和共享单车租赁数据集上比较托管与本地配置,同时由 GPT-6 Astra 实现高效的预算使用。
这条推文突出了像 Opus 5.5 和 GPT-6 Sol/Luna 这样的AI模型降价如何通过 Jevons 悖论降低成本并实现更广泛的AI用例,加速经济扩散。
Alex Finn 分享了他对 Tesla 的 Grok Bot 早期访问的兴奋之情,通过在他的 Cybertruck 中的一段视频驾驶展示了其功能。
作者描述了一个长达一个月的bug,其中代理观察器由于与文件监视器的竞态条件而静默丢弃日志行,最初被误诊为不稳定测试。修复方法是添加定期重新扫描以防止静默数据丢失。
文章描述了Qianwen Office离线论坛的流行程度,突显了科技开发者与教育培训等行业从业者在AI工具采用方面的差距,这些行业正日益使用工具来提高效率。
本文提出了一种平衡监督微调和强化学习的方法,用于训练长期广告代理,表明定向RL可以减少数据泄露,并提升企业分析任务的性能。
Meta的Muse因与OpenClaw相似而受到批评,Nat Friedman承认受到了启发,但表示它是从零开始构建的,旨在为更广泛的用途增强个人智能体。
Anthropic 披露,Claude 领导了 26% 的研发任务,参与度超过 90%,涉及 30,000 个智能体进行持续研发,并详细说明了重要的决策量和监控流程。
onPanda是一个交互式工具,使用令牌级修正来高效标注大语言模型对齐数据和智能体轨迹,将中位数标注时间减少了52%。