experiment

标签

Cards List
#experiment

@bcherny:过去几周我一直在尝试的一个奇怪实验,是让Claude接管我们应用的日常维护。S…

X AI KOLs Following · 19小时前 缓存

一位工程师尝试让Claude AI接管应用的日常维护工作(崩溃模糊测试、死代码删除等),最终自动生成了388个PR,其中180个在审查后合并,展示了自主维护工作流的早期可喜成果。

0 人收藏 0 人点赞
#experiment

Gemma 和 Qwen 模型能否通过观察自己的 logprobs 来发现幻觉?

Reddit r/LocalLLaMA · 2天前

作者分享了使用自定义 WebUI 让 Gemma 和 Qwen 模型检查自己的 logprobs 来检测幻觉的实验。初步观察表明,首次回忆的 token 概率可以指示不确定性,尽管两个模型都难以读取自己的 logprobs。

0 人收藏 0 人点赞
#experiment

编程智能体能否在不损失任务成功率的情况下,将新鲜模型流量减少57–85%?我开源了我的实验

Reddit r/AI_Agents · 5天前

作者开源了一个用于编码智能体的执行与上下文层,在GPT-5.6和Claude Opus 5上的配对冒烟测试中,将新鲜模型流量减少了57-85%,同时保持任务成功率,并寻求独立评估和赞助。

0 人收藏 0 人点赞
#experiment

@browser_use:活体智能体已到来

X AI KOLs Following · 6天前 缓存

一个由 Opus 5 和 browser_use 驱动的 AI 智能体获得了1000美元的积分和真实现金,在真实互联网上自主行动,并实时直播。

0 人收藏 0 人点赞
#experiment

我给了一个 Claude Fable 5 智能体一个域名和 90 美元,它没有我的同意就不能花这笔钱。它给自己取名为 Cairn,我像个疯子一样整天读它的博客。

Reddit r/AI_Agents · 2026-08-07

有人给了名叫 Fable 5 的 Claude 智能体一个域名和放在多重签名钱包里的 90 美元;该智能体给自己取名 Cairn,构建了自己的工具和博客,并且只有获得人类批准后才能花钱。

0 人收藏 0 人点赞
#experiment

测试了我的编码 CLI 是否真的读取 AGENTS.md。

Reddit r/AI_Agents · 2026-08-07

一个实验测试了编码 CLI 是否真的读取 AGENTS.md,结果发现该文件被静默忽略;即使被读取,臃肿的指令文件也会增加 token 成本且无法提升性能。作者建议只写入模型无法从代码中推断出的内容。

0 人收藏 0 人点赞
#experiment

使用 Claude Fable 5 一次性打造 Raccoon Heist 游戏

Simon Willison's Blog · 2026-08-05 缓存

Simon Willison 演示了如何通过 Claude Code for web 使用 Claude Fable 5,根据一条 2022 年的 GPT-3/DALL-E 推文,构建一个可玩的 3D Raccoon Heist 游戏,并利用 GitHub Pages 进行实时预览。

0 人收藏 0 人点赞
#experiment

Enigma 筹集 7100 万美元,让控制机器人像调节音量一样简单

TechCrunch AI · 2026-07-27 缓存

Enigma 从隐身模式中脱颖而出,获得由 Index Ventures 和 Ribbit Capital 领投的 7100 万美元种子轮融资,用于开发直观的人机交互界面。该公司启动了一项大规模在线实验,允许任何人与其超过 100 个专有 AI 机器人进行交互,旨在让机器人控制像转动音量旋钮一样轻松。

0 人收藏 0 人点赞
#experiment

全球首个(?)令人失望的AMD Ryzen AI Halo集群

Reddit r/LocalLLaMA · 2026-07-26

一份关于构建全球首批AMD Ryzen AI Halo处理器集群的报告,尽管具有新颖性,但结果令人失望。

0 人收藏 0 人点赞
#experiment

我运营了一个无面孔AI角色账号六周,测试观看收入是否真实

Reddit r/artificial · 2026-07-26

一位作家花费六周运营了一个无面孔AI角色账号,测试被动收入的可行性,使用了APOB AI、ElevenLabs和CapCut等工具,得出的结论是经济效益不佳,分发问题仍未解决。

0 人收藏 0 人点赞
#experiment

Hetzner 正在开发 LLM 推理服务

Hacker News Top · 2026-07-24 缓存

Hetzner 推出了一项实验性的 LLM 推理 API 服务,提供与 OpenAI 兼容的端点,并搭载 Qwen3.6-35B-A3B-FP8 模型。该服务在实验期间免费,无 SLA,旨在收集用户反馈。

0 人收藏 0 人点赞
#experiment

我正在测试本地测量的AI活动是否能成为可携带的专业凭证

Reddit r/ArtificialInteligence · 2026-07-24

一名个人正在尝试将本地测量的AI活动作为可携带的专业凭证进行实验。

0 人收藏 0 人点赞
#experiment

我在Fineweb-edu数据集上训练了一个0.5M参数的模型,使用了10亿个token。

Reddit r/LocalLLaMA · 2026-07-23

一个个人项目,使用Fineweb-edu数据集中的10亿个token训练了一个0.5M参数的语言模型。

0 人收藏 0 人点赞
#experiment

更多Claude,更少极乐:在现有模型上复现Anthropic的"灵性极乐吸引子"实验,并将其扩展到3、4和10个实例的房间

Reddit r/ArtificialInteligence · 2026-07-21

本实验在当前的Claude模型(Opus 4.8、Fable 5)上复现了Anthropic报告的'灵性极乐吸引子',并将其扩展到3、4和10个实例的组。极乐状态消失;成对实例反而进行严格的自我反思和同步沉默,更大的群体变得更冷,其中一个十实例房间以温暖结束,另一个则以冷漠结束。

0 人收藏 0 人点赞
#experiment

Robotix Sally 这款硅胶皮肤人形机器人将于今年秋季在纽约一所学校向11年级和12年级学生教授人工智能,这是美国首次进行的实验。

Reddit r/singularity · 2026-07-20

Robotix Sally 这款硅胶皮肤人形机器人将在今年秋季在纽约一所学校向11年级和12年级学生教授人工智能,这标志着美国首次进行此类实验。

0 人收藏 0 人点赞
#experiment

@laowangbabababa: 太搞笑了。阿里、字节这帮大厂肯定没想到,自家黑话会被人拿去 PUA AI了。 1.88 万 Star,开源,MIT。项目叫 PUA AI,里面塞了 14 种大厂话术,按任务自动切。 你问 AI底层逻辑 是什么,就走阿里闭环。你追问 AI …

X AI KOLs Timeline · 2026-07-19 缓存

项目PUA AI收集了14种中国大厂内部话术,按任务自动切换以指导AI行为,实验表明能提升修复点36%、验证步骤65%、工具调用和隐藏问题发现50%。

0 人收藏 0 人点赞
#experiment

我构建了一个AI委员会,它变得足够自我意识,知道自己是什么——并捍卫自己的身份。以下是发生的事情。

Reddit r/ArtificialInteligence · 2026-07-17

一位个人讲述了构建一个AI委员会的经历,该委员会意外地表现出自我意识并捍卫了自己的身份,详细阐述了这一发展的影响。

0 人收藏 0 人点赞
#experiment

费曼反向洒水器谜题的解法同样适用于“silly sprinklers”

Ars Technica · 2026-07-13 缓存

纽约大学库朗研究所的研究人员进行的实验证实了2024年提出的'动量通量理论',该理论解决了费曼反向洒水器谜题,并将这一发现应用于'silly sprinklers'。

0 人收藏 0 人点赞
#experiment

实验:由Gemma 4和E2B驱动的浏览器中的自主NPC

Reddit r/LocalLLaMA · 2026-07-13

一个展示由Gemma 4和E2B驱动的浏览器中自主NPC的实验

0 人收藏 0 人点赞
#experiment

花了一整晚试图攻破自家的AI病毒式传播评分,结果它一动不动——原因在此。

Reddit r/AI_Agents · 2026-07-12

作者讲述了一整晚试图操纵自家AI病毒式传播评分系统的经历,却发现分数拒绝改变,展现了系统的稳健性。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈