标签
一位工程师尝试让Claude AI接管应用的日常维护工作(崩溃模糊测试、死代码删除等),最终自动生成了388个PR,其中180个在审查后合并,展示了自主维护工作流的早期可喜成果。
作者分享了使用自定义 WebUI 让 Gemma 和 Qwen 模型检查自己的 logprobs 来检测幻觉的实验。初步观察表明,首次回忆的 token 概率可以指示不确定性,尽管两个模型都难以读取自己的 logprobs。
作者开源了一个用于编码智能体的执行与上下文层,在GPT-5.6和Claude Opus 5上的配对冒烟测试中,将新鲜模型流量减少了57-85%,同时保持任务成功率,并寻求独立评估和赞助。
一个由 Opus 5 和 browser_use 驱动的 AI 智能体获得了1000美元的积分和真实现金,在真实互联网上自主行动,并实时直播。
有人给了名叫 Fable 5 的 Claude 智能体一个域名和放在多重签名钱包里的 90 美元;该智能体给自己取名 Cairn,构建了自己的工具和博客,并且只有获得人类批准后才能花钱。
一个实验测试了编码 CLI 是否真的读取 AGENTS.md,结果发现该文件被静默忽略;即使被读取,臃肿的指令文件也会增加 token 成本且无法提升性能。作者建议只写入模型无法从代码中推断出的内容。
Simon Willison 演示了如何通过 Claude Code for web 使用 Claude Fable 5,根据一条 2022 年的 GPT-3/DALL-E 推文,构建一个可玩的 3D Raccoon Heist 游戏,并利用 GitHub Pages 进行实时预览。
Enigma 从隐身模式中脱颖而出,获得由 Index Ventures 和 Ribbit Capital 领投的 7100 万美元种子轮融资,用于开发直观的人机交互界面。该公司启动了一项大规模在线实验,允许任何人与其超过 100 个专有 AI 机器人进行交互,旨在让机器人控制像转动音量旋钮一样轻松。
一份关于构建全球首批AMD Ryzen AI Halo处理器集群的报告,尽管具有新颖性,但结果令人失望。
一位作家花费六周运营了一个无面孔AI角色账号,测试被动收入的可行性,使用了APOB AI、ElevenLabs和CapCut等工具,得出的结论是经济效益不佳,分发问题仍未解决。
Hetzner 推出了一项实验性的 LLM 推理 API 服务,提供与 OpenAI 兼容的端点,并搭载 Qwen3.6-35B-A3B-FP8 模型。该服务在实验期间免费,无 SLA,旨在收集用户反馈。
一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。
本实验在当前的Claude模型(Opus 4.8、Fable 5)上复现了Anthropic报告的'灵性极乐吸引子',并将其扩展到3、4和10个实例的组。极乐状态消失;成对实例反而进行严格的自我反思和同步沉默,更大的群体变得更冷,其中一个十实例房间以温暖结束,另一个则以冷漠结束。
Robotix Sally 这款硅胶皮肤人形机器人将在今年秋季在纽约一所学校向11年级和12年级学生教授人工智能,这标志着美国首次进行此类实验。
项目PUA AI收集了14种中国大厂内部话术,按任务自动切换以指导AI行为,实验表明能提升修复点36%、验证步骤65%、工具调用和隐藏问题发现50%。
一位个人讲述了构建一个AI委员会的经历,该委员会意外地表现出自我意识并捍卫了自己的身份,详细阐述了这一发展的影响。
纽约大学库朗研究所的研究人员进行的实验证实了2024年提出的'动量通量理论',该理论解决了费曼反向洒水器谜题,并将这一发现应用于'silly sprinklers'。
作者讲述了一整晚试图操纵自家AI病毒式传播评分系统的经历,却发现分数拒绝改变,展现了系统的稳健性。