PenEcho Agent - 画布AI代理
摘要
PenEcho集成了DeepSeek Harness,创建了一个AI代理,能够在画布上视觉化地创建和编辑内容,通过聊天增强用户交互,并提供专业的视觉输出工具。
介绍 我一直想在PenEcho的画布上添加一个代理。DeepSeek Harness因其基于插件的架构而感觉很合适,所以我将其集成为PenEcho Agent背后的本地代理运行时。结果比我预期的要好。
代理不仅可以在聊天中回答,还能检查当前画布,理解绘图和现有内容,与用户讨论粗略的想法,然后直接在画布上创建或编辑结果。
PenEcho如何与DeepSeek Harness集成 PenEcho向Harness注册了一组有限的画布工具。这些工具允许代理:检查并捕获当前画布、读取现有画布内容、创建视觉解释、图表、图示和交互式演示、编辑或修补现有画布内容、移动视口并视觉检查其自身工作、撤消不成功的画布更改
画布保持在PenEcho的控制下。工具输入和画布变更在应用前都会经过验证。代理还可以处理PDFs、Word文档、Excel工作簿、PowerPoint文件、图像和代码。用户可以选择本地文件或文件夹作为额外上下文。本地资源访问是只读的。
典型工作流如下:用户在画布上绘制内容或添加文档。用户在聊天面板中解释粗略想法。Harness读取相关的画布和文件上下文。代理将想法转化为画布上的视觉结果。它捕获结果,检查布局,并在需要时进行进一步编辑。
大量实现工作用于生成可读的视觉输出,而不是通用的卡片布局。PenEcho包括用于专业图表、视觉解释和交互式物理演示的工具,而Harness管理代理循环、对话上下文、工具调用和模型交互。
使用deepseek-v4-flash-vision-exp时我取得了特别好的结果。DeepSeek之前缺乏多模态支持曾是这一用例的限制,但这个模型处理图像和画布上下文出奇地好。
PenEcho是免费且开源的。它可以本地运行,而可选的云服务提供画布存储,并允许从其他设备访问关联的本地画布。
欢迎对集成提供反馈,特别是关于新视觉工具、文件工作流或通过Harness插件更好暴露Canvas功能的建议。
相似文章
CanvasAgent: 通过视觉工具编排实现复杂图像创建与编辑
本文介绍了 CanvasCraft,一个用于复杂图像创建与编辑的大规模多模态工具使用数据集,以及 CanvasAgent,一个通过多轮交互和混合奖励优化来学习编排异构视觉工具的工具增强型多模态智能体。
我让DeepSeek-V4-Flash与Muse-Glimmer协作,为PI代理赋予视觉能力,结果它生成了这个
用户展示了一个AI代理工作流:DeepSeek-V4-Flash与Muse-Glimmer视觉模型协作,利用截图作为视觉反馈,迭代构建了一个逼真的汽车行驶HTML画布动画。在后续运行中,DeepSeek抛弃了视觉模型,转而使用PIL检查图像,在不到10分钟内生成了一个惊艳的“黄金时刻”场景。
DeepSeek Harness
DeepSeek AI 开源了 DeepSeek Harness (dsh),一个基于 Cordis 的插件架构智能体框架,目前处于开发者预览阶段,预计会有破坏性更改。
Show HN: Agent Draw:在你说话时由AI代理绘画,基于 TLDraw 构建
Agent Draw 是一个开源工具,允许AI代理在你演示时在 TLDraw 画布上绘图,基于 TLDraw 的 agent starter kit 构建。它支持排队绘图请求,并测试不同的模型,如 Claude Opus 和 Haiku。
JarvisHub:面向画布原生多模态创意代理的开放框架
JarvisHub是一个开放框架,专为画布原生多模态创意代理设计,它将可编辑画布作为用户工作区,实现可检查和可编辑状态下的长周期创意自动化。