新手程序员如何开发军事应用的人工智能程序

MIT News — Artificial Intelligence 新闻

摘要

一位没有编程经验的美国空军学员使用AI聊天机器人(Claude、ChatGPT、Gemini)进行Vibe编程,开发了一款名为ROMAD-AI的军事AI应用,证明了非技术人员也可以创建用于军事的实用软件。

<p>在当今世界,人工智能聊天机器人如ChatGPT和Claude可以执行许多功能,例如撰写工作邮件和规划旅行行程。这些聊天机器人是基于大型视觉语言模型(VLM)构建的系统:这些AI在包含书籍、网站、代码和图像的海量数据集上训练。&nbsp;</p><p>然后,AI算法通过大量人类反馈进行优化,以遵循指令并避免有害或不需要的输出,并利用这些“知识”根据用户输入生成文本或图像。尽管聊天机器人有明显的局限性,但它们可以在广泛的任务中提供很大帮助,包括一些传统上需要专业技能(如计算机编程)的领域。</p><p>作为<a href="https://www.aiaccelerator.af.mil/About-Us/" target="_blank">U.S. Department of the Air Force–MIT AI Accelerator</a>的<a href="https://www.aiaccelerator.af.mil/Phantom-Program/" target="_blank">Phantom Program</a>项目的一部分,美国空军学员Joshua Lynch——在他的导师Laura Niss(麻省理工学院林肯实验室<a href="https://www.ll.mit.edu/r-d/isr-systems-and-technology/embedded-and-ai-systems" target="_blank">Embedded and AI Systems Group</a>的技术人员)的帮助下——想要验证他作为一个完全没有编程经验的新手能否开发出一个功能完整的程序。他使用了一种称为“Vibe编程”的过程,用户完全依赖提示来指导生成式AI聊天机器人编写和优化代码。&nbsp;</p><p>他的动机是让任何熟悉军事问题领域的人,无论其技术背景如何,都能推进他们的有用软件应用想法,本质上绕过了传统军事软件开发流程的时间和成本限制。Lynch旨在构建自己的应用程序,而Niss则监测他对该技术的使用体验。</p><p>“Phantom项目的学生想看看他是否能通过自我识别的Vibe编程创建一个有用的应用程序,没有任何先前经验,”Niss说。“在这个项目中,我想了解他对AI的看法如何随着使用而变化。我们都想更好地了解非技术用户可以在军事领域的何处以及如何使用AI。”</p><p>Lynch着手研究,在没有编程技能的情况下,使用聊天机器人,他能否创建一个针对他这类战术团队的应用程序,以帮助减少附带损害,同时提高更广泛任务中的生存能力。该应用程序将提供AI辅助目标识别、模块化情报监视侦察、自主打击以及战场通信管理等功能。&nbsp;</p><p>在项目期间,Lynch完成了多门AI专业发展课程,并熟悉了该技术的军事和非军事用途。作为代码生成的基础,他使用了三个AI聊天机器人的付费模型:Anthropic的Claude、OpenAI的ChatGPT和Google的Gemini。大部分工作仅通过Web浏览器上的聊天机器人主聊天功能完成,而不是像现在标准做法那样作为开发环境中的集成系统。最终应用程序使用Google AI Studio App生成,该应用可以创建与Gemini应用程序编程接口交互的应用,并在开发环境中集成了AI。&nbsp;</p><p>在三个月的时间里,Lynch使用这些模型构建了他的应用程序,称为远程操作模块化增强设备(ROMAD-AI)。在此期间,他学习了几种改进代码输出的方法。例如,他经常遇到AI聊天机器人缺乏层次关注和修改无关代码部分的困难。他发现将问题分解成小部分、清晰提出问题以及在对话偏离目标太远时引导其回到正轨非常重要。&nbsp;</p><p>学会识别聊天机器人的局限性并有效规避它们占据了项目大部分时间。随着Lynch对聊天机器人有了更多经验,AI能力的限制和开发时间导致他重新调整项目范围,从能够协助战场的应用程序转变为能够执行基本文档处理(例如分析战场战术地图并通过与VLM驱动的聊天机器人界面生成任务规划文档)的应用程序。虽然最终原型并未实现Lynch最初计划的所有功能(在当前迭代中,对于预期用例也不安全),但它证明了此类应用程序对军人的能力和实用性。</p><p>“我对这个最终产品印象深刻,它向我展示了这些系统在非专家原型设计方面的强大能力,”Niss说。“我现在认为,这些可以成为非技术专家向技术专家传达问题和可能解决方案的强大工具,并有助于沟通期望的结果。”</p><p>Niss观察到Lynch在此过程中对AI语言模型看法的变化。在开始时就设定了一个令人印象深刻的目标后,Lynch逐渐了解了当前技术的能力,并在项目期结束时大幅下调了期望。随着时间的推移和系统的更新,他对不同AI系统的感知测量数据对Lynch和Niss尤其有趣,Claude在可爱度、拟人化和感知智能等特征上比ChatGPT更稳定。Lynch发现AI是一位有用的导师,但注意到在他熟悉的主题上AI存在不准确之处。</p><p>该项目表明,AI聊天机器人可以赋予非技术人员能力,为他们独特的问题生成可行的软件应用程序,尽管在处理敏感信息和关键应用时,它作为原型设计助手比作为完整生产工具效果更好。代码审查不当可能导致安全风险,例如有一次Lynch没有意识到最终应用程序将输入文档发送到Gemini AI模型进行分析,而不是在本地计算机上解析文档。尽管AI可以生成大量可功能的代码,但代码审查仍然是该领域的瓶颈。</p><p>“对我来说,这个项目强化了不同领域专家之间的差距,”Niss说。“无论AI变得多好,我认为我们总是需要合作来为最重要的问题找到最佳解决方案。”</p><p>该研究由美国空军部人工智能加速器资助,并在合作协议编号FA8750-19-2-1000下完成。</p>
查看原文
查看缓存全文

缓存时间: 2026/07/07 22:34

# 新手程序员如何为军事应用开发 AI 程序 来源:https://news.mit.edu/2026/how-novice-coders-can-develop-ai-programs-for-military-applications-0707 在当今世界,诸如 ChatGPT 和 Claude 这样的人工智能聊天机器人可以执行许多功能,例如撰写工作邮件和规划旅行行程。这些聊天机器人是围绕大型视觉语言模型 (VLM) 构建的系统:这是一种在包括书籍、网站、代码和图像在内的大规模数据集上训练的 AI。 然后,这些 AI 算法通过大量人类生成的反馈进行微调,以遵循指令并避免有害或不想要的输出,并利用这些“知识”根据用户的输入生成文本或图像。尽管聊天机器人有明显的局限性,但它们对广泛的任务都非常有帮助,包括一些传统上需要专业技能(如计算机编程)的领域。 作为美国空军部–MIT AI 加速器 (https://www.aiaccelerator.af.mil/About-Us/) 的“Phantom 计划”(https://www.aiaccelerator.af.mil/Phantom-Program/) 项目的一部分,美国空军学员 Joshua Lynch——在他的导师、MIT 林肯实验室嵌入式与 AI 系统组 (https://www.ll.mit.edu/r-d/isr-systems-and-technology/embedded-and-ai-systems) 的技术人员 Laura Niss 的帮助下——想要确定,作为编程的完全新手,他能否开发出一个功能完整的程序。他采用了一种称为“氛围编码 (vibe-coding)”的过程,用户完全依靠提示词来引导生成式 AI 聊天机器人编写和完善代码。 他的动机是让任何熟悉军事问题领域的人,无论其技术背景如何,都能推进他们关于实用软件应用的想法,从而绕过传统军事软件开发流程中的时间和成本限制。Lynch 的目标是构建自己的应用程序,而 Niss 则监控他对该技术的使用体验。 “这位 Phantom 学员想知道,在没有任何编程经验的情况下,他能否通过自己认定的‘氛围编码’创建出一个有用的应用程序,”Niss 说。“在这个项目中,我想了解他对 AI 的看法如何随着使用而变化。我们都想更好地了解 AI 在军事领域可以被非技术用户用在哪些地方以及如何使用。” Lynch 着手验证,从零编程技能开始,仅使用聊天机器人,他能否创建出一个针对他所在战术团队的应用程序,以帮助减少附带损害,同时提高更广泛任务中的生存能力。该应用程序将提供包括 AI 辅助目标识别、模块化情报监视侦察、自主打击以及战场通信管理等能力。 在项目期间,Lynch 完成了若干 AI 专业发展课程,并熟悉了该技术的军事和非军事用途。作为代码生成的基础,他使用了三个 AI 聊天机器人的付费模型:Anthropic 的 Claude、OpenAI 的 ChatGPT 和 Google 的 Gemini。大部分工作仅通过网页浏览器上聊天机器人的主要聊天功能完成,而未像现在的标准做法那样集成到开发环境中。最终的应用程序是使用 Google AI Studio App 生成的,该应用可以创建与 Gemini 应用程序编程接口交互的应用程序,并且在开发环境中集成了 AI。 在三个月的时间里,Lynch 与这些模型合作构建了他的应用程序,名为“远程操作模块化增强装置 (ROMAD-AI)”。在此期间,他学到了几种改善代码输出的方法。例如,他经常遇到 AI 聊天机器人缺乏层级关注、修改无关代码部分的问题。他发现,将问题分解成小部分、清晰陈述问题以及在对话偏离目标太远时将其引导回正轨非常重要。 学会识别聊天机器人的局限并有效绕过它们占据了项目的大部分时间。随着 Lynch 对聊天机器人获得更多经验,AI 能力的局限性和开发时间的不足导致他重新调整了项目范围,从原来能协助战场的应用程序,转向一个能执行基本文档处理的应用,例如通过一个由 VLM 驱动的聊天机器人界面分析战场战术地图并生成任务规划文档。虽然最终的原型未能实现 Lynch 最初设定的所有能力(且在当前的迭代中,对于期望的使用场景不够安全),但它证明了此类应用程序对军人的能力和实用性。 “我对这个最终产品印象深刻,它向我展示了这些系统在非专家的原型设计方面有多么强大,”Niss 说。“我现在认为,对于非技术专家来说,这些可以成为强大的工具,用于向技术专家传达问题和可能的解决方案,并有助于沟通期望的结果。” Niss 观察了 Lynch 在使用过程中对 AI 语言模型看法的变化。从一个令人印象深刻的目标开始,Lynch 逐渐理解了当前技术的能力,并在项目结束时显著降低了他的期望。随着时间的推移以及系统更新的过程中,他对不同 AI 系统的感知度量特别有趣,其中 Claude 在可爱度、拟人化和感知智能等特征上比 ChatGPT 表现出更高的稳定性。Lynch 发现 AI 是一位有用的导师,但指出它在他熟悉的主题上存在不准确性。 该项目表明,AI 聊天机器人可以让非技术军人能够为其独特的问题生成可用的软件应用程序,尽管在处理敏感信息和关键应用时,它更适合作为原型设计助手而不是完整的生产工具。代码审查不当可能导致安全风险,正如一个实例所证明的那样:Lynch 没有意识到最终应用程序正在将输入的文档发送给 Gemini AI 模型进行分析,而不是在他的计算机本地解析文档。尽管 AI 可以生成大量功能性代码,但代码审查仍然是这一领域的瓶颈。 “对我来说,这个项目强化了不同领域专家之间的差距,”Niss 说。“无论 AI 变得多好,我认为我们始终需要合作,才能为最重要的问题找到最佳解决方案。” 该研究由美国空军部人工智能加速器赞助,并在合作协议编号 FA8750-19-2-1000 下完成。

相似文章

将ChatGPT引入GenAI.mil

OpenAI Blog

OpenAI宣布将定制版ChatGPT部署到GenAI.mil,这是美国国防部安全的、由300万人员使用的企业级AI平台,以支持非机密军事行动,包括文档分析、采购起草和行政任务,并内置安全控制和数据隔离。