标签
AI指南合作更新至v7,更诚实地反思未解决的矛盾和方法论,包括重新评估一个关键术语的情感色彩和一个隐喻的有效性,外加一次外部评审,澄清了模型情感与训练数据偏差之间的区别。
本文介绍了一种人工智能代理,能够在不同数据集中重现人类分析的差异,并发现不同角色会导致截然不同的结论。它提出了m-value和Agentic Bootstrap来评估所报告分析的可信度。
一份关于设计有效机器学习实验的详细指南,强调从明确的研究问题开始,培养研究品味,并扩展结果。基于作者在Poolside每周运行约100次实验的经验。
提出一种协议,通过预注册实验并在预注册后第一个符合条件的模型上运行实验,来减轻基于LLM的研究中的p值操纵,并在多个模型上展示了显著的减轻效果。
本文分享了一篇由Anthropic研究员Vivek Nair撰写的关于如何做好研究的文章,强调选择问题比解决问题更重要、培养研究品味、升级信息源以及将写作作为思考工具,这些见解不仅适用于学术研究,也对职业发展和投资判断有启发。
本研究探讨了当仅提供研究问题时,LLM如何推荐研究方法(数据集、模型、指标),发现LLM表现出强烈的提供者偏差,且相比实际论文所提出的方法范围要窄得多,这可能会缩小研究者的方法论搜索空间。
这篇博客文章主张在计算机体系结构中回归严谨的全系统时序仿真,以克服“时序仿真墙”并准确捕捉现代系统行为,提倡使用统计上可靠的方法测量正确的执行区间,而不是详细仿真一切。
分享了一篇关于如何做好AI研究的方法论文章,强调选择问题、阅读文献、写作记录等技巧,适用于科研人员。
本文介绍了 PEEL(AI 认识参与素养协议)框架,该框架将 Voyant Tools 的确定性文本分析与 Claude 的大语言模型解释相结合,以皮尔斯符号学为理论基础,旨在揭示 AI 生成的研究摘要中的系统性失真,并促进认识论层面的问责。
yibie 分享了 awesome-autoresearch 列表的三条新条目,涵盖自动量化交易、通用技能优化和 Claude Code 插件。
Yann LeCun 对比了工程师思维(专注于产品创新和交付足够好的解决方案)与科学家思维(专注于提出新问题、提出解决方案和严谨的方法论),指出两者都是活动而非身份,并且产品创新建立在早期的科学进步之上。
来自Google DeepMind和卡内基梅隆大学的这篇论文指出,由于用户漂移(模拟人群随干预措施而变化),LLM模拟实验实际上属于观察性研究。作者提出使用阴性对照结果来诊断混杂,并表明引出与情境相关的混杂因素可以减少偏差。
一项实验用同一个关于LENR和超导性的研究提示词,通过5种语言的6个AI系统运行,揭示了显著的语言偏差——非英语查询会呈现出纯英语搜索所遗漏的真实工业承诺信息。
这篇立场论文认为,机器学习研究应优先考虑思想而非基准和理论保证,提出了一种“Ideas First”框架,该框架重视行为特征和定制实验,以促进公平性和科学理解。