PixelClaw:用于图像处理的 LLM 智能体
摘要
PixelClaw 是一款免费开源的 LLM 智能体,在基于 Raylib 的拖放界面中融合对话式 AI、图像生成与编辑以及音频工具。
我正在开发一款专注于图像处理的 LLM 智能体,它整合了:
* 用于对话、规划和工具调用的 LLM(支持多种大模型)
* 通过 gpt-image 实现图像生成/AI 编辑
* 借助 rembg 实现背景移除(提供多款专用模型)
* 使用 pyxelate 进行像素化
* 采用自定义算法实现色调分离与去边缘色带
* 语音识别(Whisper)与语音合成(Kokoro 及 [HALO](https://github.com/JoeStrout/HALO))
* 基于 Raylib 的友好界面,支持文件拖放
PixelClaw 完全免费且开源,地址:[https://github.com/JoeStrout/PixelClaw/](https://github.com/JoeStrout/PixelClaw/)。
那里还有更多演示视频。如果感兴趣,请顺手点个 ⭐️,这能帮我了解大家的关注程度。
相似文章
VisualClaw: 面向物理世界的实时个性化智能体
VisualClaw是一种自我进化的多模态智能体,通过混合编码和技能进化降低部署成本,同时在多个基准测试中提高了视频问答的准确性。
GenClaw: 代码驱动的智能体图像生成
GenClaw 提出了一种代码驱动的智能体图像生成框架,通过模拟人类的创作过程来打破黑箱范式:概念构思、使用代码(SVG/HTML/Three.js)进行草图绘制,然后利用生成模型添加纹理和实现逼真效果。
COMFYCLAW:面向图像生成工作流的自进化技能框架
ComfyClaw是一种用于ComfyUI图像生成工作流的代理技能进化框架,利用类型化图编辑和区域级VLM验证器将视觉故障转化为修复建议,在多个配置中优于基线方法。
OpenClaw 2.0
OpenClaw 2.0 是一款开源 AI 代理,通过自动密钥检测简化设置过程,并支持多人团队功能,用于本地设备的浏览器控制和文件管理。
BetterClaw
BetterClaw 支持在60秒内部署AI代理,且零成本,旨在实现快速、免费的代理部署。