experimentation

标签

Cards List
#experimentation

我们开源了Tahuna,并启动了Hillclimb,一个自主的机器学习实验循环

Reddit r/AI_Agents · 4天前

Tahuna被开源,为初创公司和企业提供编排计算、训练模型和自主机器学习实验的工具。Hillclimb被引入作为机器学习研究中迭代改进的自主工具。

0 人收藏 0 人点赞
#experimentation

@BenjaminDEKR: 如果让10,000个AI代理处理难题能在几周内解决,我们应该这样做,然后在大约十一月解决数据中心争论d…

X AI KOLs Timeline · 2026-09-09 缓存

该推文提议使用10,000个AI代理快速解决难题,旨在11月前解决数据中心争论,并批评GPU浪费在琐碎内容上,同时建议进行可重复性测试。

0 人收藏 0 人点赞
#experimentation

ZX Spectrum:实验1位声音

Hacker News Top · 2026-09-08 缓存

作者在ZX Spectrum上实验PCM和PWM声音技术,以实现多声道1位音频播放,并记录了过程中的成功与失败。

0 人收藏 0 人点赞
#experimentation

Lovable 发布草稿功能用于并行应用实验(3分钟阅读)

TLDR AI · 2026-09-08 缓存

Lovable 发布草稿功能,这项功能允许用户创建其应用项目的并行版本,用于实验和协作,而不影响线上版本。

0 人收藏 0 人点赞
#experimentation

@eliebakouch:使用技能来改变模型的输出风格是否也会影响其思考链?是的!尝试告诉模型……

X AI KOLs Following · 2026-08-23 缓存

这条推文探讨了使用技能改变模型输出风格是否会影响其思考链,并指出DeepSeek V4 Pro很少使用破折号。

0 人收藏 0 人点赞
#experimentation

我让一个多智能体团队花五天时间构建一个项目,但它拒绝宣布结果完成

Reddit r/AI_Agents · 2026-08-22

作者使用oh-my-subagents进行多智能体工作流实验,历时五天构建产品,强调此类系统中的监督使失败可见且可恢复,而非消除失败。

0 人收藏 0 人点赞
#experimentation

重建我的自定义代理式AI,因为原始架构过于沉重

Reddit r/AI_Agents · 2026-08-15

作者正在重建一个自定义代理式AI,以用轻量级系统替换基于LLM的沉重架构,该系统具有自己的智能层,用于实现感知和决策等能力。

0 人收藏 0 人点赞
#experimentation

DiG-bench:游戏中的发现

arXiv cs.AI · 2026-08-14 缓存

介绍 DiG-bench,一个包含70个游戏的基准测试,旨在通过主动实验测试 AI 智能体发现隐藏规则和目标的能力,具有七个难度等级。

0 人收藏 0 人点赞
#experimentation

我们给智能体加过最好的东西不是一项能力,而是一个撤销按钮

Reddit r/AI_Agents · 2026-08-06

作者认为,添加撤销按钮——而非新功能——才真正解锁了对AI智能体的实验,并指出智能体设计的核心其实是降低回退变更的成本。

0 人收藏 0 人点赞
#experimentation

@ArizePhoenix: 你可以直接使用PXI在Phoenix上运行实验!这里有一个测试系统提示与schema感知提示的实验…

X AI KOLs Following · 2026-07-27 缓存

Arize Phoenix演示了如何使用PXI运行一个实验,该实验使用程序化代码评估器比较系统提示与schema感知提示,从而避免了使用LLM评审员的需求。

0 人收藏 0 人点赞
#experimentation

我在一个月的假账目中植入了六个错误,看我的AI智能体能发现几个。它们发现了五个。漏掉的那个才是最可怕的部分。

Reddit r/AI_Agents · 2026-07-15

一项实验在虚假记账数据中植入了六个错误,AI智能体发现五个;特别值得注意的是,当数据不足时它们会拒绝猜测,凸显出不确定性意识比纯粹准确率更有价值。

0 人收藏 0 人点赞
#experimentation

用于运行关于使用工具的智能体的受控实验的开源实验室(改变工具名称/角色/历史,测量效果)

Reddit r/AI_Agents · 2026-07-02

一个开源实验室框架,用于运行关于使用工具的智能体的受控实验,允许改变工具名称、角色和历史来测量效果。

0 人收藏 0 人点赞
#experimentation

auto-psych: 利用智能体驱动的理论发现与实验自动化心智科学

arXiv cs.AI · 2026-06-26 缓存

auto-psych 是一个基于智能体的系统,它利用LLM智能体生成假设、设计实验并分析来自众包参与者的数据,从而自动化计算认知科学中的理论发现与实验。该系统在经典的心理学范式中展示出比人类推导的理论更快、更优的理论生成能力。

0 人收藏 0 人点赞
#experimentation

我用Claude建了一个250页的网站,并且记录了它每一次胡说八道的证据

Reddit r/artificial · 2026-06-24

作者记录了使用Claude构建一个250页网站的过程,并跟踪了AI模型每一次产生虚假或误导信息的情况。

0 人收藏 0 人点赞
#experimentation

本地大语言模型已不再民主...硬件门槛已失控。

Reddit r/LocalLLaMA · 2026-06-12

作者认为,由于硬件成本高昂,运行本地大语言模型已变得难以企及,这与早期消费级GPU尚能胜任的情况形成鲜明对比,并对看似不再民主的访问权表达了不满。

0 人收藏 0 人点赞
#experimentation

AI是否变得太过"安全",以至于对创意工作实际上毫无用处?

Reddit r/artificial · 2026-05-31

文章认为,过于安全且受到审查的AI模型阻碍了创意探索,而开放模型则提供了更多的实验自由。

0 人收藏 0 人点赞
#experimentation

注意仿真与现实的差距,并像科学家一样思考

arXiv cs.AI · 2026-05-22 缓存

本文研究在序贯决策问题中,规划者何时以及如何用真实实验补充预训练模拟器,提出Fisher-SEP以最小化目标策略值的后验方差。

0 人收藏 0 人点赞
#experimentation

利用LLM评估进行更好的实验——是漏斗,而非分叉(阅读时间约6分钟)

TLDR AI · 2026-05-21 缓存

Spotify Engineering讨论了将LLM评估用作A/B实验前的漏斗,提高了命中率,并在评估与实验之间建立了反馈循环。

0 人收藏 0 人点赞
#experimentation

@andrewchen:体验本地AI模型的主要缺点在于你会买一块GPU,然后另一块,接着又一块……

X AI KOLs Following · 2026-05-19 缓存

Andrew Chen分享了他为本地AI实验购买多块GPU的经历,在5090 eGPU上以100 tok/s运行Qwen3.6 27B密集模型,并将其与Sonnet 4.6进行比较。

0 人收藏 0 人点赞
#experimentation

我花费了200美元的Claude积分,通过1000场战斗训练了一辆AI坦克

Reddit r/ArtificialInteligence · 2026-05-14

用户构建了AgentArena,这是一个浏览器游戏,Claude在其中编写坦克控制代码并通过战斗迭代,使得AI代理的改进过程变得可见。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈