标签
本文介绍了一种通过偏好学习聚合多个弱指标的分数来提高文本摘要事实一致性的方法,在各种语言模型上实现了一致的事实性提升。
MemFail是一个诊断基准,通过形式化总结、存储和检索操作,并用对抗性设计的数据集进行评估,来隔离LLM记忆系统的故障模式。
本文探讨了在临床摘要生成中从导出的大语言模型表征推断敏感信息的风险,表明减少一个向量工件的泄露并不能保证其他工件的隐私。提出了SurfaceLoRA,一种微调方法,可在保持效用的同时减少从目标向量中恢复种族信息的能力。
介绍了用于长时间范围LLM智能体的并行上下文压缩,实现了对摘要量的细粒度控制,并相比多个骨干模型上的顺序同步压缩,降低了端到端延迟。
一篇 Meta 论文显示,编程代理在重复使用过去尝试的简短摘要而非原始日志时性能显著提升,使用 Claude 4.5 Opus 在 SWE-Bench 和 Terminal-Bench 上取得了显著改进。
Meetily 是一款以隐私为先、开源的 AI 会议助手,能够完全在用户的基础设施上本地捕获、转录和总结会议。
本文提出了一种基于证据的模型,可从无查询摘要数据集中自动生成查询关键词,从而创建查询聚焦摘要数据集。实验结果表明,使用基于证据的查询生成的摘要与原始查询生成的摘要相比,获得了具有竞争力的ROUGE分数。
SCURank 引入“摘要内容单元”对候选摘要打分,使从多个大模型蒸馏出的小模型超越传统指标与单一模型蒸馏效果。
一位新手在尝试用 Qwen2.5-7B-Instruct 给员工笔记做摘要时遭遇幻觉,现求助适用于 2000 token 以内、能合并同类标签的小模型及提示策略。
本文介绍了单向对话问题(1SC),针对在远程医疗和呼叫中心等现实场景中,仅有一方发言转录的情况下,如何重建缺失的对话内容和生成摘要。作者在多个数据集上评估了提示和微调模型,发现访问未来上下文和话语长度信息能改进重建效果,同时无需完整对话重建即可生成高质量摘要。
<p>让用户使用他们喜欢的 AI 来总结您的网站</p><p><a href="https://www.producthunt.com/products/aicw-summarize-widget?utm_campaign=producthunt-atom-posts-feed&amp;medium=rss-feed&amp;source=producthunt-atom-posts-feed">讨论区</a> | <a href="https://www.producthunt.com/r/p/1125443?app_id=339">链接</a></p>
OpenAI 展示了一种可扩展的对齐技术,使用人工反馈进行整本书的分层摘要总结,展示了如何训练模型在复杂、难以评估的任务上按照人类意图行动。
OpenAI展示了一种通过在人类偏好上训练奖励模型并使用强化学习微调模型来改进语言模型总结的技术,实现了在数据集间具有良好泛化性能的显著质量提升。这项工作通过大规模人类反馈推进了模型对齐,并具有超越总结任务的应用前景。
OpenAI展示了使用人类偏好反馈对GPT-2(774M参数)进行微调,用于文本续写和摘要任务,风格任务需要5000个标签,摘要任务需要60000个标签,模型达到了86-88%的人类偏好率,但揭示了标注者启发式利用的问题。
Meetily 是一款开源的、注重隐私的 AI 会议助手,它本地运行,用于捕捉、转录和总结会议,无需将数据发送到云端。它包括一个 PRO 版本,具有增强准确性和自定义工作流等高级功能。
一个AI智能体技能,可跨多个平台(包括Reddit、X、YouTube、Hacker News、Polymarket及网络)研究任何主题,然后综合过去30天的活动,生成一份有依据的总结。
NVIDIA发布了一个参考蓝图,用于构建视觉智能体和AI驱动的视频分析应用,包括实时智能、下游分析以及用于搜索、摘要和问答的智能体工作流。