标签
本文介绍了HalluPeer,这是一个基于分类体系的基准测试,用于检测科学同行评审中的幻觉,并提供了标注数据以评估和改进检测方法。
天文学家在土星南部大气中发现了一个十边形多边形结构,类似于北极已知的六边形,表明这种多边形波可以在两个极地区域形成。
本文介绍了Sci-ZSEL,这是一个成本高效的零样本科学实体链接框架,它选择性地使用LLMs和一个本体感知过滤器,以提高在低词汇重叠基准测试上的性能。
本文介绍了 Scientific Agent Skills,一个开源库,包含16个科学领域的163项程序性知识技能,旨在帮助AI研究代理执行可辩护的分析。
Qwen3.8-Max已升级至0902版本,经过编程与协作的进一步后训练,在复杂企业任务、科学研究和长期工作流程中提升了性能。
由Philip Johnston领导的私人团体宣布Fermi Explorer任务,旨在发射低成本航天器至Alpha Centauri以研究Fermi悖论,计划利用现有技术在2029年前发射。
AutoSciRub 是一个评估优先框架,通过生成任务特定的可执行评分标准来指导实验和验证,从而改进自主科学代理,在基准测试中实现一致的性能提升。
Nancy Grace Roman太空望远镜已成功发射,将利用其先进的红外相机和日冕仪系统,以比哈勃望远镜快1000倍的速度勘测宇宙,研究暗物质、暗能量和系外行星。
Google DeepMind 发表了一篇关于使用 AI 智能体进行实际科学研究的论文,表明它们在诸如 HealthBench Hard 的计算机科学任务中能够超越前沿模型。
Terminal-Bench-Science是一个由斯坦福大学研究人员开发的基准,用于评估AI智能体在真实科学研究工作流中的表现,旨在推动科学领域AI能力的提升。
Terminal-Bench-Science 是一个新基准,版本0.1.0,用于评估AI代理在科学研究工作流上的表现,由斯坦福社区主导开发。
本文报道尼泊尔致命洪水事件,可能由气温上升导致冰川崩塌引发,突显气候变化与冰川不稳定性之间的科学关联。
尝试了Apodex 1.1新版更新,发现其在任务处理、3D分子视图渲染和增量计算方面有显著改进,非常适合科研人员使用。
本文提出一个框架,用于确保在大语言模型辅助的研究中认知合法性和问责性,强调人类验证和所有权的重要性。
科学家们利用从蜘蛛网上收集的环境DNA来监测生物多样性和保护工作,而人工蜘蛛网作为生态监测的经济高效替代方案,显示出巨大潜力。
这篇文章讨论了像ChatGPT这样的AI工具如何通过反复引用热门论文,强化科学引用中的马太效应,类似于人类行为,这可能阻碍研究创新。
Inherent,一家由DeepMind校友创立的初创公司,声称其AI代理Faraday在复制科学研究方面超越了Anthropic和OpenAI模型,使用了一个较小的模型通过强化学习来培养‘研究品味’。
本文提出了一种基于Rust的多智能体架构,利用LLM幻觉作为特性来生成和评估科学假设,并将其性能与直接提示和其他方法进行比较。
科学家发布了迄今最大的二维宇宙地图,这是一张5.6万亿像素的图像,覆盖了天空的75%,以促进对暗能量和其他宇宙现象的研究。
文章推测了将全球用于数百万AI提示的计算资源集中到一个单一科学问题上,如治愈癌症的潜在影响,并质疑这是否能带来更深层次的科学智能。