scientific-research

标签

Cards List
#scientific-research

HalluPeer:一个基于分类体系的科学同行评审幻觉检测基准测试

arXiv cs.AI ↗ · 2026-09-04 缓存

本文介绍了HalluPeer,这是一个基于分类体系的基准测试,用于检测科学同行评审中的幻觉,并提供了标注数据以评估和改进检测方法。

0 人收藏 0 人点赞
#scientific-research

天文学家在土星大气中探测到十边形结构

Hacker News Top ↗ · 2026-09-03 缓存

天文学家在土星南部大气中发现了一个十边形多边形结构,类似于北极已知的六边形,表明这种多边形波可以在两个极地区域形成。

0 人收藏 0 人点赞
#scientific-research

弥合词汇差异:LLM辅助、成本高效、零样本科学实体链接

arXiv cs.CL ↗ · 2026-09-02 缓存

本文介绍了Sci-ZSEL,这是一个成本高效的零样本科学实体链接框架,它选择性地使用LLMs和一个本体感知过滤器,以提高在低词汇重叠基准测试上的性能。

0 人收藏 0 人点赞
#scientific-research

Scientific Agent Skills: 面向研究代理的程序性知识库

arXiv cs.CL ↗ · 2026-09-02 缓存

本文介绍了 Scientific Agent Skills,一个开源库,包含16个科学领域的163项程序性知识技能,旨在帮助AI研究代理执行可辩护的分析。

0 人收藏 0 人点赞
#scientific-research

Qwen3.8-Max刚刚升级。全新Qwen3.8-Max-0902登场!

Reddit r/singularity ↗ · 2026-09-02

Qwen3.8-Max已升级至0902版本,经过编程与协作的进一步后训练,在复杂企业任务、科学研究和长期工作流程中提升了性能。

0 人收藏 0 人点赞
#scientific-research

私人团体计划发射“最低成本”任务至Alpha Centauri

Ars Technica ↗ · 2026-09-01 缓存

由Philip Johnston领导的私人团体宣布Fermi Explorer任务,旨在发射低成本航天器至Alpha Centauri以研究Fermi悖论,计划利用现有技术在2029年前发射。

0 人收藏 0 人点赞
#scientific-research

在改进之前学习评估:自动研究代理的自动评分标准归纳

Hugging Face Daily Papers ↗ · 2026-08-31 缓存

AutoSciRub 是一个评估优先框架,通过生成任务特定的可执行评分标准来指导实验和验证,从而改进自主科学代理,在基准测试中实现一致的性能提升。

0 人收藏 0 人点赞
#scientific-research

Nancy Grace Roman太空望远镜发射以研究暗物质和暗能量

The Verge ↗ · 2026-08-30 缓存

Nancy Grace Roman太空望远镜已成功发射,将利用其先进的红外相机和日冕仪系统,以比哈勃望远镜快1000倍的速度勘测宇宙,研究暗物质、暗能量和系外行星。

0 人收藏 0 人点赞
#scientific-research

@dair_ai: 令人瞩目的新成果来自 Google DeepMind,展示了智能体在科学研究中的实际应用。

X AI KOLs Timeline ↗ · 2026-08-28 缓存

Google DeepMind 发表了一篇关于使用 AI 智能体进行实际科学研究的论文,表明它们在诸如 HealthBench Hard 的计算机科学任务中能够超越前沿模型。

0 人收藏 0 人点赞
#scientific-research

Terminal-Bench-Science: 在科学研究工作流中评估AI智能体

Hacker News Top ↗ · 2026-08-28 缓存

Terminal-Bench-Science是一个由斯坦福大学研究人员开发的基准,用于评估AI智能体在真实科学研究工作流中的表现,旨在推动科学领域AI能力的提升。

1 人收藏 1 人点赞
#scientific-research

@himanshustwts: 我试图理解TB-science的任务设计哲学。他们明确拒绝了诸如 - 教科书微分…

X AI KOLs Timeline ↗ · 2026-08-27 缓存

Terminal-Bench-Science 是一个新基准,版本0.1.0,用于评估AI代理在科学研究工作流上的表现,由斯坦福社区主导开发。

0 人收藏 0 人点赞
#scientific-research

气温升高可能如何促成尼泊尔致命洪水

Wired ↗ · 2026-08-26 缓存

本文报道尼泊尔致命洪水事件,可能由气温上升导致冰川崩塌引发,突显气候变化与冰川不稳定性之间的科学关联。

0 人收藏 0 人点赞
#scientific-research

@dingyi: 尝试了下 Apodex 1.1 新版的更新,又进化了很多,比如我直接用官方给的案例「KRAS G12D 突变体与小分子抑制剂结合构象」测试,虽然我不懂生物医学,但通过整个流程可以看出这个产品的很多细节确实非常用心。比如: • 自动拆任务并…

X AI KOLs Timeline ↗ · 2026-08-26 缓存

尝试了Apodex 1.1新版更新,发现其在任务处理、3D分子视图渲染和增量计算方面有显著改进,非常适合科研人员使用。

0 人收藏 0 人点赞
#scientific-research

伦理的LLM辅助研究:负责委托、验证和认知价值的框架

arXiv cs.AI ↗ · 2026-08-26 缓存

本文提出一个框架,用于确保在大语言模型辅助的研究中认知合法性和问责性,强调人类验证和所有权的重要性。

0 人收藏 0 人点赞
#scientific-research

欢迎进入蜘蛛世界,一个以蛛网度量的天地

MIT Technology Review ↗ · 2026-08-25 缓存

科学家们利用从蜘蛛网上收集的环境DNA来监测生物多样性和保护工作,而人工蜘蛛网作为生态监测的经济高效替代方案,显示出巨大潜力。

0 人收藏 0 人点赞
#scientific-research

AI 反复引用相同的论文——就像人类一样

Reddit r/ArtificialInteligence ↗ · 2026-08-24 缓存

这篇文章讨论了像ChatGPT这样的AI工具如何通过反复引用热门论文,强化科学引用中的马太效应,类似于人类行为,这可能阻碍研究创新。

0 人收藏 0 人点赞
#scientific-research

Inherent(由DeepMind校友创立)称其AI‘队友’刚刚在复制研究方面超越了Anthropic和OpenAI

TechCrunch AI ↗ · 2026-08-22 缓存

Inherent,一家由DeepMind校友创立的初创公司,声称其AI代理Faraday在复制科学研究方面超越了Anthropic和OpenAI模型,使用了一个较小的模型通过强化学习来培养‘研究品味’。

0 人收藏 0 人点赞
#scientific-research

幻觉作为特性而非缺陷:评估多智能体架构将推测性语言模型输出转化为可测试科学假设的能力

arXiv cs.CL ↗ · 2026-08-21 缓存

本文提出了一种基于Rust的多智能体架构,利用LLM幻觉作为特性来生成和评估科学假设,并将其性能与直接提示和其他方法进行比较。

0 人收藏 0 人点赞
#scientific-research

科学家发布迄今最大二维宇宙地图

Hacker News Top ↗ · 2026-08-20 缓存

科学家发布了迄今最大的二维宇宙地图,这是一张5.6万亿像素的图像,覆盖了天空的75%,以促进对暗能量和其他宇宙现象的研究。

0 人收藏 0 人点赞
#scientific-research

如果我们把当前用于数百万提示的计算资源全部投入到一个单一的AI问题中,会发生什么?

Reddit r/singularity ↗ · 2026-08-19

文章推测了将全球用于数百万AI提示的计算资源集中到一个单一科学问题上,如治愈癌症的潜在影响,并质疑这是否能带来更深层次的科学智能。

0 人收藏 0 人点赞
← Previous
Next →
← 返回首页

提交意见反馈