标签
Tahuna被开源,为初创公司和企业提供编排计算、训练模型和自主机器学习实验的工具。Hillclimb被引入作为机器学习研究中迭代改进的自主工具。
该推文提议使用10,000个AI代理快速解决难题,旨在11月前解决数据中心争论,并批评GPU浪费在琐碎内容上,同时建议进行可重复性测试。
作者在ZX Spectrum上实验PCM和PWM声音技术,以实现多声道1位音频播放,并记录了过程中的成功与失败。
Lovable 发布草稿功能,这项功能允许用户创建其应用项目的并行版本,用于实验和协作,而不影响线上版本。
这条推文探讨了使用技能改变模型输出风格是否会影响其思考链,并指出DeepSeek V4 Pro很少使用破折号。
作者使用oh-my-subagents进行多智能体工作流实验,历时五天构建产品,强调此类系统中的监督使失败可见且可恢复,而非消除失败。
作者正在重建一个自定义代理式AI,以用轻量级系统替换基于LLM的沉重架构,该系统具有自己的智能层,用于实现感知和决策等能力。
介绍 DiG-bench,一个包含70个游戏的基准测试,旨在通过主动实验测试 AI 智能体发现隐藏规则和目标的能力,具有七个难度等级。
作者认为,添加撤销按钮——而非新功能——才真正解锁了对AI智能体的实验,并指出智能体设计的核心其实是降低回退变更的成本。
Arize Phoenix演示了如何使用PXI运行一个实验,该实验使用程序化代码评估器比较系统提示与schema感知提示,从而避免了使用LLM评审员的需求。
一项实验在虚假记账数据中植入了六个错误,AI智能体发现五个;特别值得注意的是,当数据不足时它们会拒绝猜测,凸显出不确定性意识比纯粹准确率更有价值。
一个开源实验室框架,用于运行关于使用工具的智能体的受控实验,允许改变工具名称、角色和历史来测量效果。
auto-psych 是一个基于智能体的系统,它利用LLM智能体生成假设、设计实验并分析来自众包参与者的数据,从而自动化计算认知科学中的理论发现与实验。该系统在经典的心理学范式中展示出比人类推导的理论更快、更优的理论生成能力。
作者记录了使用Claude构建一个250页网站的过程,并跟踪了AI模型每一次产生虚假或误导信息的情况。
作者认为,由于硬件成本高昂,运行本地大语言模型已变得难以企及,这与早期消费级GPU尚能胜任的情况形成鲜明对比,并对看似不再民主的访问权表达了不满。
文章认为,过于安全且受到审查的AI模型阻碍了创意探索,而开放模型则提供了更多的实验自由。
本文研究在序贯决策问题中,规划者何时以及如何用真实实验补充预训练模拟器,提出Fisher-SEP以最小化目标策略值的后验方差。
Spotify Engineering讨论了将LLM评估用作A/B实验前的漏斗,提高了命中率,并在评估与实验之间建立了反馈循环。
Andrew Chen分享了他为本地AI实验购买多块GPU的经历,在5090 eGPU上以100 tok/s运行Qwen3.6 27B密集模型,并将其与Sonnet 4.6进行比较。
用户构建了AgentArena,这是一个浏览器游戏,Claude在其中编写坦克控制代码并通过战斗迭代,使得AI代理的改进过程变得可见。