OpenCode Senses:专为 OpenCode 打造的真正理解图像的高级本地视觉插件

Reddit r/LocalLLaMA 工具

摘要

OpenCode Senses 是一款专为 OpenCode 设计的本地视觉插件,提供先进的图像理解功能,如 OCR、物体检测和颜色分析,完全在本地硬件上私密运行,无需 API 密钥。

OpenCode Senses 可以检查截图、提取精确的 OCR 文本、检测并定位对象、放大区域、比较两张图像、测量颜色、裁剪和标注图像,甚至可以进行反向搜索。所有功能都在本地运行,因此私密、免费,无需 API 密钥。 我之所以构建这个插件,是因为我过去使用过许多开源编码模型,如 DeepSeek V4 Flash,这些模型目前还不支持视觉功能(直到现在)。但我主要担心的是,即使这些新发布的开源模型内部支持视觉,其视觉能力可能也不如专用的视觉层。我原计划在一个月前完全构建这个插件,但仍有一些工作要做。该插件专为 UI 设计、调试以及其他纯文本模型难以处理的工作流而设计,因为它们根本无法看到正在发生的事情。视觉插件与 OpenCode 之间的通信层被有意设计得非常狭窄,因此它仍然感觉像是在与多模态代理一起工作,而不是一个单独的视觉工具。在将其视为只是另一个视觉插件之前,它的设计方式相当不同。它是一个 Python + TypeScript 混合插件,因为它集成了 Photon Inference Engine 用于本地视觉推理。 目前共有 13 种工具:inspect — 理解图像:场景、布局、元素、标题和 OCR。ocr — 提取精确文本,包括代码和错误消息。detect — 查找对象或 UI 元素并带有边界框。point — 定位对象或元素的中心点。segment — 从图像中隔离对象。crop — 使用归一化坐标裁剪特定区域。zoom — 放大区域并重新分析细节或文本。colors — 获取确定性颜色、调色板、亮度和 RGB 数据。diff — 比较两张图像并找到变化区域。annotate — 在图像上绘制检测到的框和点。metadata — 检查图像格式、尺寸、大小、DPI 和 EXIF。reverse — 本地或通过 Yandex 进行反向图像搜索。status — 检查模型、设备、显存、推理时间和运行时状态。 作为对比,在我的 RTX 3050 上使用这个插件,完全本地运行时,我获得了大约 300 毫秒的响应时间(现在工具调用只需 84 毫秒,因此根据主模型的每秒令牌数,速度提升了 3.6 倍,我得到的最快时间是 38 毫秒)。与前沿模型相比,这速度极快。还有一个可选的由 Yandex 驱动的反向图像搜索功能(也支持新的 SauceNAO 和 TraceMoe 作为提供者),无需 API 密钥,如果您想使用互联网上下文搜索图像。OpenCode 中的内部网络搜索服务如 Exa 与 OpenCode Senses 配合良好。它甚至可以直接查看互联网上发布的图像,尽管使用小型本地缓存来存储这些图像。我仍然在构建过程中,因此非常欢迎反馈、想法和批评。如果您有任何想法,请随时在下方评论,我会进行查看。 注意:我曾在这个插件发布在 r/opencodeCLI 上(人们非常喜欢使用它!),有人问我是否可以支持 AMD 硬件,有人想在他的 9070XT 上运行它。不幸的是,我没有 AMD 硬件。我只有 Nvidia GPU。不过,我为它创建了一个 issue。插件的大部分推理引擎由 Photon(kestrel)处理。如果您想添加 AMD 支持,也可以在这个 issue 上请求和添加评论。https://github.com/m87-labs/kestrel/issues/179 有人也让我提供 Pi 代理支持,但我不知道如何实现,因为我认为 Pi 代理生态系统相当分散或脱节,欢迎贡献者!如果您有任何建议,请在插件仓库创建 issue,或者在这里评论您需要的任何未来工具。另外,如果您喜欢我所做的,这里是我的 Buy Me A Coffee ☕ GitHub: https://github.com/itsmeadarsh2008/opencode-senses NPM: https://www.npmjs.com/package/opencode-senses Hacker News: https://news.ycombinator.com/item?id=49289890
查看原文

相似文章

opencv/opencv

GitHub Trending (daily)

OpenCV是一个开源计算机视觉库,提供图像处理、机器学习和人工智能开发的工具。

OpenCode Superapp

Product Hunt

OpenCode Superapp 将 Codex 的能力与本地托管的 AI 模型以及语音编码功能相结合。

OpenCV 5 正式发布:计算机视觉多年来的最大飞跃

Hacker News Top

OpenCV 5 是计算机视觉库的重大版本更新,包含全新的 DNN 引擎、改进的 ONNX 支持、硬件加速以及更简洁的架构。对于从事经典视觉、深度学习及边缘部署的开发者而言,这标志着一次重要的现代化升级。