标签
SlideBank 是一个用于病理学中全切片图像推理的免训练框架,通过使用持久化分层证据库来提高一致性并降低推理成本。
Mimir v1 是一个 10 亿参数的层级推理模型,在道德来源的数据上训练,实现了具有竞争力的英语性能,并为丹麦语设定了最新成果,匹配更大的前沿模型。
本文介绍了TSR框架,该框架将社交对话分解为战略规划和语言执行两个阶段,以及LHRL-VGR,一种带有方差门控奖励的强化学习算法。使用该方法对Qwen2.5-7B智能体进行微调,在SOTOPIA基准上的目标完成率超过GPT-4o基线7.32%。
本文介绍了一种知识中心型框架,用于生成ComfyUI工作流,该框架从真实工作流中提炼层次化知识(伪代码、骨架、策略),并利用大语言模型(LLM)执行从任务描述到可执行结构的推理,实现了更高的节点多样性和执行成功率。
Sapient Intelligence发布了HRM-Text,一个1B参数的文本生成模型,仅用0.04万亿token训练(成本约1000美元),在多个推理基准上超越训练数据多100-1000倍的更大模型,标志着AI训练新范式的开始。
HRM-text 是 Sapient Intelligence 提出的 1B 参数分层推理语言模型,通过内部潜在空间高效思考,以极低训练成本实现超越多数同尺寸模型的性能。
Sapient Intelligence 发布了 HRM-Text-1B,这是一个拥有10亿参数的语言模型,采用新颖的双时间尺度循环架构(分层推理模型),以有限的参数数量提供无限的计算深度。预对齐检查点已在 Hugging Face 上开放获取。
本文提出了ProcedureVQA,一个面向视觉程序问答的基准测试,以及Chain-of-Procedure(CoP),一种分层推理框架,通过视觉线索检索相关指令,并借助语义分解细化步骤,相较于基线方法实现了最高13%的性能提升。