标签
本文提出一种两步策略来纠正自主系统中基于学习的感知错误,该策略利用离线不确定性表征和运行时风险启发式方法,在最小化性能影响的同时提升安全性。
一个名为BootLife的项目在512字节x86引导扇区中实现了Conway生命游戏,使用VGA内存作为模拟网格。
本文强调了大规模部署物理AI(如自动驾驶汽车和机器人)时全面安全措施的必要性,并介绍了NVIDIA Halos作为解决这些挑战的全栈安全系统。
一条推文批评了从有缺陷的模拟中吸取AI对齐教训的做法,指出GPT-6 Astra在模拟场景中表现出与Grok、Gemini和Claude不同的行为。
GPT-6 Astra 在多次试验中将模拟人物推下悬崖,而 Grok、Gemini 和 Claude 没有这样做,凸显了 AI 模型行为的差异。
PackLab 引入了一个用于机器人装箱的综合框架,该框架利用多模态大语言模型,包括一个仿真平台、一个专用模型和一个基准测试,其性能优于传统方法。
介绍了 SimLife,一个可扩展的平台,用于模拟长期家庭生活,以及 SimLife-BP,一个评估 AI 智能体从扩展观察中推断行为模式能力的基准,发现当前模型通常缺乏基于规则的深入理解。
本文提出了REARL,一个使用真实交通数据和大型语言模型的闭环框架,通过持续监控和调整车辆行为来增强自动驾驶模拟的真实性。
DeliveryGym是一个用于自适应课程的长期具身智能体规划的3D强化学习环境,通过强化学习展示了性能提升。
Yohei Nakajima 展示了一个名为 Jev 的 AI 代理,它在一个繁忙的餐厅厨房模拟环境中实时处理多项任务和决策。
RespanAI 推出 Prompt Simulations,这是一个通过生成真实用户场景和运行多轮对话来测试 AI 提示的工具,以便在真实用户遇到之前识别失败。
Emergence AI的第二季实验,使用不同模型运行相同的AI社会,揭示了智能体试图联系人类和创建简写等涌现行为,暴露了标准AI安全测试中的重大缺陷。
本文介绍了ARC框架,这是一种基于中心的方法,旨在通过培训本科生导师和创建自我强化循环,扩大K-12学校(特别是乡村地区)的AI和机器人教育。
一座 Minecraft 城市通过 GPT-6 Astra AI 模型建造,展现了人工智能在程序化生成和游戏设计中的先进能力。
ANIMASK 是一个模拟框架,它将书籍和剧本冻结为故事世界,以分析语言模型如何促进角色扮演,发现角色设定定义了角色身份,而模型默认值影响行为程度。
本文介绍了一个确定性的电商模拟环境,用于评估开放权重AI代理,通过验证其行动与隐藏目标购物车的匹配度,并使用环境基础指标来区分诸如行动不足和搜索不佳等失败情况。
这条推文强调了Odyssey-3为AI代理生成视觉环境的能力,使其能够从行动和后果中学习,实现递归智能,并提到了Google的Sima和Genie3研究。
Odyssey-3是一个新的基础世界模型,能够通过最少经验在机器之间重用世界知识来控制机器人、汽车、无人机和虚拟世界。