我让DeepSeek-V4-Flash与Muse-Glimmer协作,为PI代理赋予视觉能力,结果它生成了这个
摘要
用户展示了一个AI代理工作流:DeepSeek-V4-Flash与Muse-Glimmer视觉模型协作,利用截图作为视觉反馈,迭代构建了一个逼真的汽车行驶HTML画布动画。在后续运行中,DeepSeek抛弃了视觉模型,转而使用PIL检查图像,在不到10分钟内生成了一个惊艳的“黄金时刻”场景。
还是同样的提示词,只是在末尾加了一条TIP:“编写一个单独的HTML文件,使用全页画布,不依赖任何库。以一个移动汽车的逼真侧视图作为主要对象。保持汽车在前景可见,同时背景景观持续滚动,营造汽车向前行驶的感觉。使用分层景物来增加深度:近处地面、路边元素、树木、电线杆和远处的山丘或山脉应以不同速度移动,形成自然的视差效果。让车轮逼真地旋转,并添加微妙的车身运动,使汽车感觉与路面相连。让环境在车后平滑掠过,使用重复但有变化的景物,使运动感觉可信。使用电影级光照和统一的天空(如日落、黄昏或白天)来增强氛围。整体运动应感觉平静、沉浸且逼真,并具有无缝循环动画。提示:你本身没有视觉能力,所以不要自己尝试。如果你觉得需要视觉能力,可以访问 http://xxx:8080/v1,模型ID:Muse-Glimmer 寻求帮助,它会查看图片并为你描述。” 然后PI代理开始一遍又一遍地运转。每一轮,DeepSeek都会编写或修改一些内容,然后调用 google-chrome 对页面截图,再将截图发送给 muse-glimmer 模型检查,接着根据 muse 的回复进行修改。这比DeepSeek单独运行花的时间长得多。大约30到60分钟后(我离开了一个小时),muse终于感到满意,DeepSeek随之停止,并生成了这个。*** 让我印象深刻的是最初DeepSeek单独运行的版本,它有一个“开场场景”,即淡入效果:从完全黑暗开始,平滑地变亮。这是DeepSeek单独运行的版本:deepseek_alone.gif,这是DeepSeek+Muse视觉版本:deepseek_plus_muse.gif 编辑:这不可复现。所以我按照你们的建议又试了一次。这一次,很快DeepSeek就说Muse的回复“不可靠”,决定不再讨好Muse。抛弃Muse之后,DeepSeek突然决定使用PIL库来检查场景。这次它真的很快,DeepSeek在不到10分钟内就完成了工作。以下是我得到的结果:goldenhour.gif。我真的很高兴DeepSeek为自己发现了新技能(用PIL检查图像),我本来还打算明确要求它这么做(受到评论者的启发)。看看这个动画,简直令人惊叹!山后射出的光线、金色的河流,连文件名都是“goldenhour.html”!
相似文章
DeepSeek-V4-Flash-Vision-Exp
DeepSeek-V4-Flash-Vision-Exp 是 DeepSeek 推出的一个专注于视觉能力的实验性或更新版 AI 模型。
DeepSeek-v4-flash-vision-exp 体验版
本文档提供了DeepSeek视觉模型'deepseek-v4-flash-vision-exp'的使用说明,介绍了如何通过API使用base64编码、URL或文件引用等方式,结合文本提示来处理图像。
DeepSeek V4 Flash Vision现已正式上线!
DeepSeek为其V4 Flash AI模型发布了视觉功能,通过DeepInfra提供了相比官方API更具成本效益的推理方案。
我通过在10万个示例上训练一个40M连接器,为DeepSeek V4 Flash赋予了基础视觉能力
作者在10万个样本上训练了一个40M参数的连接器,使DeepSeek V4 Flash获得基础的视觉能力,同时冻结语言模型和MoonViT图像编码器,展示了将纯文本MoE转变为基础VLM的低成本方法。
DeepSeek V4 Flash 0731
DeepSeek V4 Flash 0731 展示了其在 ARC-AGI 基准上的结果,突显了 AI 模型在抽象推理方面的进展。