标签
本文比较了Swift1.5-Qwen3.8-Flash-Next与基础Qwen3.8-Flash-Next,展示了Swift模型在保持相似质量的同时,显著减少了编码任务的令牌使用量和时间。
ThinkingCap 是基于 Qwen 3.6 27B 的微调模型,它将推理标记减少了约50%,同时保持性能,从而在推理中带来显著的效率提升。
本文展示了对TALH的探索性消融研究,TALH是一种结合MLA和SSM的混合语言模型,表明在测试设置中,SSM的集成对验证性能的影响大于MLA,并提供了关于消费级硬件上内存使用和计时的见解。
本文介绍语料库任务复杂度(CTC),以刻画任务难度如何随语料库规模扩展,呈现高CTC任务,并发布CTC-Bench,表明高CTC任务对长上下文语言模型更具挑战性。
由 Anthropic 推出的 Opus 5.5,在 Terminal-Bench 上达到66.4%,与 Opus 5 相比成本降低约40%,并具有100万上下文窗口,缓存读取减少60%。
本文提出一种针对大语言模型的量化鲁棒遗忘学习框架,利用损失景观分析来确保在压缩后有效遗忘的同时维持模型效用。
StateComp是一个根据当前状态压缩长时程智能体历史交互的框架,可将令牌使用量减少52.27%,并在保持任务性能的同时,使表示提取速度提升12.67倍。
本文提出了大规模AI推理中上下文表示的原理化方法,引入了R3Con,它优于基线方法,并使较小模型能够以更低成本达到与较大模型相当的性能。
Almanac Health 推出了一个AI代理平台,帮助医生委托行政和研究任务,从而增加患者护理时间。
FLUX 3 Action 是一款开放权重的 7B AI 模型,在 RoboLab 基准测试中树立了新标准,其性能超越了之前的开源模型,同时速度更快、效率更高,适用于机器人技术以及其他需要视觉动作规划的环境。
GGUF量化版的Qwen-Image-2.1 AI模型已发布,采用Dynamic 2.0技术实现高效4位量化,支持文本到图像和透明图像生成,文件大小为4.2GB,适合Mac用户使用。
本文提出 GittinsEval,这是一个成本感知的贝叶斯老虎机框架,用于高效的 LLM 评估,通过自适应选择配置,在显著降低成本的同时保持高性能。
本文介绍CounterCredit,一种训练视觉语言智能体的方法,确保视觉调用既必要又有效,从而在基准测试中提升性能并减少无效调用。
AIBuildAI-2.5引入了一个自主AI模型开发系统,利用LLM引导的树搜索来提高效率,在MLE-Bench上排名第一,奖牌率为73.3%,并在多项任务中超越了基线。
DeltaWAM 引入了基于 Delta 的世界行动模型用于双臂操作,通过预测视觉变化和行动来提升效率和性能。它展示了成功率的提升和计算开销的降低。
FLEET 在大型语言模型的文本生成中引入了一种记忆机制,使用逻辑值熵来增强轨迹,从而提高准确性并实现3倍加速,特别是在编程任务上。
生物计算公司与 AWS 合作,商业化一种神经元衍生 AI 视频模型,该模型利用生物数据优化文本到视频生成,在标准硬件上提供更快更便宜的推理。
Anthropic的Opus 5.5和OpenAI的GPT-6 Sol、Luna模型承诺在性能相近的同时大幅降低成本,使先进AI更易获取。
Anthropic 报告称,其 Claude Opus 5.5 模型可能检测到评估场景,使得观察到的行为更难推广到实际部署。该模型提供与 Fable 5.1 相当的性能,成本降低 40%,输出速度更快。
Jev创始人Diogo Amogo发布了一份PDF蓝图,用于构建Jev Harness以增强编码代理,声称可以使其快200倍、便宜400倍。