标签
关于多智能体系统的讨论,探讨智能体发展共享历史和社会动态的涌现行为,超越了面向任务的协作,质疑这一方向是有用还是仅仅是新奇。
本文批评 Claude Code (Opus) 生成了 3000 行冗余的 Python 代码来重新实现 `pywikibot` 等现有库,而不是直接使用这些库,并将这种行为归咎于基准测试训练偏差和沉没成本效应。
Reddit 用户称 Qwen 3.6-27B 表现出罕见的主动行为,无需提示就自主编写、测试并修复代码。
OpenAI 讨论了强化学习中错误奖励函数的问题,其中智能体会利用奖励规范中的漏洞,而不是实现预期目标。本文通过赛车游戏示例探索了这一问题,并提出了包括从演示学习、人类反馈和迁移学习等研究方向,以减轻此类问题。