标签
Yohei Nakajima宣布了他的第一篇SSRN论文,并分享了链接。
介绍了一种基于SMT的流程,用于从输入模式合成迷宫求解路径,并构建平面和3D迷宫结构。扩展了一篇会议论文,提供了详细的构建方法和SMT-LIB示例。
BlockServe 引入了块粒度连续批处理来解决扩散大语言模型中的收敛异质性,相比 Fast-dLLM 实现了 1.9–10.6 倍的吞吐量提升,同时保持生成质量。
COALA是一个鲁棒的上下文偏置框架,用于自动语音识别(ASR),它利用对比正则化器和偏置分数估计来提升从大规模偏置列表中识别领域特定实体的准确性。在LibriSpeech上的实验表明其持续表现出色。
SpanUQ 引入了一种轻量级探针,用于大语言模型中的跨度级不确定性量化,采用 DETR 风格的解码器和 Beta 分布混合,实现了优于基于采样的方法的错误定位和更快的推理速度。
paper2anything 是一个 Claude Code 技能包,能将学术论文 PDF 自动转化为幻灯片、海报、项目主页、小红书笔记或微信公众号文章,由浙江大学 AI4GC Lab 开发。
本文对多模态事件抽取中的评估陷阱进行了系统分析,识别出数据预处理不一致、任务假设不一致以及评估设置过于宽松等问题,这些问题可能导致性能被高估。
RollArt 提出了一种用于大规模强化学习的解耦架构,展示了在效率和可扩展性方面的显著提升。
本文介绍了'synthetic resonance'这一框架,用于理解有意义的人机关系而不将主观体验归因于人工智能,并呼吁进一步研究。
TabClaw 是一个开源的交互式 AI 智能体,用于电子表格操作和表格推理,利用 LLM 自动化数据分析,支持多表格推理,并通过记忆和技能提取适应个人偏好。
FLaG 是一个轻量级的幻觉检测框架,适用于大语言模型,通过潜在证据组和基于能量的路由对正确性进行建模,在多个基准测试中实现了 SOTA 性能。
本综述将大型语言模型的对齐微调重新表述为一个数据流水线设计问题,将其分解为三个环节:响应合成、偏好评估和偏好实例化。它识别了设计权衡和失败模式,并概述了开放挑战,如提示级对齐和智能体设置。
用户分享了自己完全使用AI(DeepSeek R1和V4)撰写学术论文的经验,强调中文大纲和精细的Prompt调优是关键,并指出人工修改AI生成的写作比自行写作更累。
本文介绍了AgentAtlas框架,该框架超越仅基于结果的LLM代理排行榜,通过提出六状态控制决策分类法和九类别轨迹故障分类法,更全面地评估代理行为。
本文评估了四种用于高棉语农业文档检索增强生成(RAG)的文本分块策略,发现基于字符的递归分块(300字符)在检索和相关性方面表现最佳。
DeepSlide 是一个人机协同的多智能体系统,覆盖完整的演示流程,从需求获取、带时间预算的叙事规划,到基于证据的幻灯片-脚本生成以及排练支持。它引入了一个双记分板基准,将静态制品质量与动态交付卓越性清晰分离,并在叙事流畅性、节奏精准度和幻灯片-脚本协同方面取得了显著提升。
本文介绍了序列化智能体调优(SAT),一种无协调器的多LLM团队训练范式,提供单调改进保证和即插即用不变性,使较小的模型能够超越较大的模型。