标签
Keenable SELECT 是一个MCP服务器,使AI代理能够在实时网络数据上执行SQL查询,使用语义运算符进行高效搜索和提取,并生成HTML报告。
Lieflat Charts是一款开源工具,已在GitHub上获得2k星标,能让AI代理通过HTML创建具有超过60种图表类型的美观图表,支持丰富动画和报告生成。
为客户构建AI报告生成器揭示出大部分工作量用于数据标准化和模板化,而模型只是一个次要组件,强调了数据管道相对于生成的首要性。
作者构建了一个用于市场调研的AI智能体,自动化报告组装但仍需人类判断进行上下文决策,突显了AI自动化与人类专业知识在知识工作中的平衡。
RadFusion 是一个通过将多标签分类器与基于 VQA 的生成器以及 LLM 重写步骤相融合,为放射学报告生成增加阈值可控性的框架,支持灵敏度-特异性的权衡以及基于 ROC 的验证。在 MIMIC-CXR 上的实验表明,其诊断准确性得到提升,报告行为也更适应临床需求。
一位开发者分享了在生产环境中运行AI报告生成器的经验教训,认为数据质量和验证远比模型的写作能力重要,因为流畅但错误的报告是危险的。
介绍了MCTS-Report,一种基于蒙特卡洛树搜索的框架,用于从表格数据生成多模态报告,同时提出了MMRBench基准。它在结构完整性、数值准确性、图表-文本对齐和洞察新颖性方面优于强基线。
本文强调,用于胸部X光报告生成的 VLMs 在基准测试中能取得高分,但同时会抹去有临床意义的术语并引入有偏见的语言,并提出一个框架来度量这些失败。
本文改编了一种扩散语言模型用于交互式放射学报告起草,表明其在准确性上与自回归模型相当,同时提供独特的填充能力,使放射科医生能够修复报告片段并让模型填充它们之间的文本。
本文介绍了一种过渡感知型Best-of-N采样方法,这是一种无需训练的方法,通过使用集合到集合的距离度量来编码既往与当前检查之间的变化,从而生成纵向胸部X光报告。
本文研究了将大语言模型适配到3D CT报告生成的参数高效策略,提出了RAD3D-Prefix,一个轻量级的诊断先验条件框架,该框架保持LLM冻结,仅需极少的可训练参数。结果表明,冻结更大的LLM(约10亿参数以上)并仅训练轻量级投影层,能够在性能、泛化能力和计算效率之间实现更优的权衡。
一个开源项目,提供Opencode Skill,通过四阶段流水线(大纲→数据采集→并行撰写→验收装配)自动生成对标券商/研究机构标准的深度调研报告。成本低于0.6元,耗时10–20分钟,支持19种语言输出,适合独立开发者和研究者。
来自香港科技大学、字节跳动和UCL的研究人员提出了SCORE——一种协同进化训练框架,将LLM同时训练为深度研究报告生成器和评估器,并通过元约束机制动态调整评估难度,防止奖励饱和。实验表明,该方法在开放式研究报告质量上取得了持续提升。
介绍了TVIR,一个用于生成文本-视觉交织报告的基准和层次化多代理框架,评估了自动化报告生成中的事实可靠性和视觉对齐。
本文提出 Ptah,一种多智能体框架,通过专门智能体和验证机制交错文本与视觉证据,生成可验证的多模态深度研究报告,并引入 PtahEval 进行评估。
本文展示了如何使用AI工具Sense Nova Skills,通过一个简单的提示词生成完整的全球电动汽车行业研究报告,并附上了GitHub仓库和插件的链接。
AnchorDiff提出了一种拓扑感知的掩码扩散框架用于放射学报告生成,整合了基于RadGraph的临床锚点和基于置信度的重写,在MIMIC-CXR和MIMIC-RG4基准测试上取得了最先进的结果。
Google DeepMind 推出 Deep Research 与 Deep Research Max,两款基于 Gemini 3.1 Pro 的自主智能体,可浏览网络及自定义数据,生成带完整引用的专业报告。
DR³-Eval 是一个基准测试,用于评估深度研究代理在多模态、多文件报告生成中的表现,它通过真实的网络环境模拟和全面的评估框架,衡量信息召回、事实准确性、引用覆盖率、指令遵循和深度质量。