标签
LLM4LLM引入了一个部署感知的闭环优化框架,用于桥接内核基准测试和实际LLM推理,在H100 GPU上实现了高达6.98倍的加速。
This paper evaluates large language models as autonomous co-pilots for digital agriculture, using a 49-channel phytosensor network and closed-loop control to optimize plant growth, reduce production cycles by 35%, and achieve significant energy savings.
介绍了 CMU-Drive,一个用于协同多智能体自动驾驶的闭环基准,以及 V2V-VLA,一个联合生成驾驶动作、路径点、推理和通信策略的视觉-语言-行动模型。这为协同 VLA 驾驶提供了首个基准和基线。
介绍了 PIRL(策略改进强化学习)及其实际实现 PIPO,这是一种闭环框架,通过将策略更新后的性能与历史锚点进行比较来验证更新效果,从而能够纠正或强化之前的更新。实验表明,在 PPO 和 GRPO 等现有强化学习算法之上应用时,在数学推理、代码生成、工具使用和自我蒸馏方面均有一致的提升。
本文将基于LLM的闭环通道配置搜索扩展到每周期250个候选,在CIFAR-100上展示了正向的准确率趋势和参数效率提升,并揭示了LLM生成的通道先验中的架构规律性。
本文介绍TANS-FO,一个用于定制足部矫形器闭环生成设计的研究原型,采用文本对齐神经代理与图神经网络预测足底应力。该系统在参数化CAD基础上实现代理预测的峰值压力降低34.7%,但需人工审核,且尚未获得监管批准。
本文提出了一种基于LLM的流水线,利用GPT-5、GPT-4o和Claude Sonnet 4自动设计跨语言手写OCR的神经网络架构,在阿拉伯语、英语和波斯语文本上实现了超过93%的准确率,无需人工干预。
一项基于访谈的研究,涵盖六个国家的九家公司,考察当前自动驾驶系统测试实践、挑战和未来趋势,提出了一个以证据为中心的闭环测试框架。
LingBot-VA 2.0 是一个从头开始为机器人控制训练的视频动作基础模型,实现了 225 Hz 的闭环执行,具有 13B 参数(每个 token 激活 1.9B),并在 RoboTwin 2.0 上优于之前的模型。
介绍了AdaJEPA,一种自适应世界模型,在部署期间持续学习并更新其潜在表征,使智能体能够根据真实世界观测调整计划,无需重新训练或记忆技巧。
介绍了AdaJEPA,一个自适应世界模型,通过感知、规划和行动在闭环中持续学习。
介绍具身CAD(Embodied CAD),一个闭环框架,将LLM智能体置于CAD执行环境中,用于参数化B-Rep装配建模,利用求解器反馈进行规划和优化。
介绍了能力切片这一单元,用于将评估失败与LLM中的数据干预联系起来,实现诊断和修复模型弱点的闭环流程。通过两个案例研究进行演示,展示了从训练回归中恢复以及数学推理能力的显著提升。
ENPIRE是一个框架,通过环境反馈、策略优化和进化代码优化的闭环系统,使机器人能够在现实世界中自主实现策略自我改进,在灵巧操作任务上达到99%的成功率。
本文介绍了PersonaDrive,一种将视觉-语言-动作(VLA)驾驶智能体基于从风格引导的人类驾驶数据集中检索到的演示进行条件化的流程,从而能够为闭环仿真提供风格多样的非自车智能体,并在Bench2Drive上提升了驾驶评分。
一位开发者分享了在多个代理运行中可视化失败聚类如何改变了他们的调试方法,强调了建立反馈循环的必要性,使代理能够从过去的错误中学习,而不是将失败视为孤立的问题。文章提到了手动变通方法和一个名为BentoLabs的平台,该平台实现了闭环改进。
文章认为,使用LLM进行研究需要一个闭环系统,如Karpathy的LLM Wiki或Recall AI知识库,以防止幻觉,确保所有输出都基于可信的源文档。
提出了Reason-Imagine-Act (RIA),一种将大语言模型推理器与动作条件世界模型相结合的闭环框架,用于自动驾驶中的在线安全验证,在CARLA仿真中实现了80.05%的路线完成率和0.20%的碰撞率。
SEAL提出了一个闭环框架,用于联合演化LLM智能体及其训练环境,利用诊断引导的标签对齐双方。仅用400个训练样本,它就在多轮工具使用任务上取得了显著提升,表现出更好的鲁棒性和分布外迁移能力。