标签
本文探讨AI在加速单个任务的同时是否转移了更广泛工作流程中的瓶颈,强调需要衡量端到端流程的改进,并考虑在工具连接性、所有权和步骤上的优化。
FlexEE介绍了一种自推测和KV缓存兼容的早期退出框架,用于卸载部署中的高效LLM推理,在Llama模型上实现了显著加速,且精度损失最小化。
VideoMM 引入了一种自适应宏微观推理框架,可减少视频MLLMs中的视觉token开销,实现6.13倍的速度提升和7.4%的准确率增益,从而高效地理解长视频。
EchoPath 引入了一种模型无关的记忆系统,用于GUI代理,该系统重放经过验证的执行轨迹,显著降低了企业重复任务的token成本和执行时间。
本文提出了NarraLite,一个高效的多模态生成式推荐框架,它利用潜在叙事推理来改进剧集内容预测,以提高准确性和效率。
State of Thought (SoT) 为LLMs提出内生推理,通过提取内部动态几何状态来选择性激活历史支持,提高各种推理任务的准确性和效率。
Diogo Almeida发布了JEV,这是一个新的AI模型,它作为智能switch语句处理分类和路由等任务,声称在速度和效率上显著优于现有模型。
本文建议开发者在使用Codex等AI工具构建项目前,先在GitHub搜索现有解决方案,以避免浪费时间和资源。
本文介绍了GAVEL,这是一个使用图世界模型来验证和修复机器人任务长时域LLM规划的框架,显著提高了仿真中的成功率和效率。
CERA-MoA介绍了一个协同进化框架,用于混合代理系统,该框架使用强化学习动态路由查询并调整代理能力,从而提升任务性能和效率。
这条推文宣布 sol 5.6 正在为选定用户路由到 sol 6,强调了其强化学习优化和速度,并承诺将与 OpenAI 和 Anthropic 模型进行比较。
LayerRoute引入了一种参数高效的自适应transformer层跳过方法,结合了逐层路由与联合LoRA微调,在LLM推理中实现了经过验证的速度提升和质量改进。
UkisAI 对 Qwen 3.8 27B 模型进行了后训练,以减少不必要的思考令牌,从而在准确率损失不到1%的情况下,实现思考量降低58%和速度提升1.95倍,模型已开源并提供免费的研究API。
大众汽车的Mission Efficiency原型车在空气动力学阻力和电动汽车能效方面创下新纪录,风阻系数仅为0.158,在实际测试中能耗极低。
本文研究了用于代码生成LLMs后训练的离线强化学习,表明通过使用现有数据集,无需在线采样,就能提升零样本代码生成的性能。
作者分享了一个个人领悟,即使用AI Agent帮助他理解了延误的连锁效应,并联系到课堂上的教训。
Recurrent Looped Transformer (RLT) 是一种新颖的架构,它结合了因果编码器和循环解码器,以实现具有无界时间深度的潜在推理、模型-硬件协同设计以及模型-强化学习算法协同设计。
本文比较了特斯拉Semi、沃尔沃和斯堪尼亚电动半挂卡车的续航里程和能效,认为尽管特斯拉续航较低,但其更高的能效可能因成本和欧洲的运营考虑而更具优势。
该论文介绍了声明式注意力技术,LLMs明确声明需要关注哪些上下文段,从而将令牌使用量最多减少52%,同时准确率下降极小。