Open WebUI + Open Terminal
摘要
作者介绍了如何通过集成 Open Terminal 与 Open WebUI,构建一个基于 Ollama 上 Qwen 27B 模型的自托管 AI 智能体。该智能体可通过 shell 命令检索大型法律文档并生成笔记。作者强调,终端访问让模型能够逐步推理,并从远超上下文窗口限制的大型文档中精准提取相关章节。
背景:我不会编程。我的需求是文档研究与文档撰写(主要用于法律检索),比如在税法这类大型文档(500 多页)中检索内容,并根据结果整理笔记或制作 PPTX。
我在 Unraid 设备上运行 Open WebUI 已有一段时间,它连接的是我推理机器(5060 Ti + 5070 Ti)的 API。我折腾了很久。我曾在主力机上试过 Hermes,同样对接该 API。效果还不错,但配置过于复杂,而且裸机安装让我感到不安。我也尝试过 LM Studio Bionic,结果尚可,但它不符合我对推理架构组织方式的预期(我希望在推理机上使用 Ollama)。
我真正想要的是一个能与 Open WebUI 配合工作的自托管智能体,同时保证安全可控。有一段时间我甚至考虑在每个客户端上安装 Hermes 或 Pi 这类工具,然后直接连接 API。最终,我尝试了 Open Terminal。
它是 Open WebUI 项目推出的配套容器,能为模型提供 shell 环境——你将它作为独立容器运行,再通过 Integrations 进行连接,因此无需将其安装在 Open WebUI 内部。我的实例以非特权模式运行,网络模式为 bridge,并将 appdata 挂载到 /home/user。模型获得的是一个隔离容器内的 shell,而非宿主机的 shell。这正是我最看重的部分。
这大大增强了 Open WebUI 的能力。如今模型可以逐步推理,并且借助终端,能够可靠地在远超上下文窗口的大型文档中定位并提取正确的章节——列出文件夹、grep 筛选、只读取关键内容。然后它会利用这些结果生成文档,就像其他智能体一样。
配置如下:Ollama 上运行 Qwen 27B Q4_K_M,上下文长度设置为 100k。在约 35k token 的 prompt 下,我测得 prompt 处理速度约为 1,050 t/s,生成速度约为 46 t/s。对于这个使用场景,预填充速度(Prefill speed)才是核心指标——它决定了处理大型文档时的体验是否可接受。我当时差点就要放弃 Open WebUI 了。如果你的使用场景与我类似,千万别忽视 Open Terminal。
相似文章
Open WebUI 的更简单的自托管替代方案
OvertChat 是 Open WebUI 的一个更简单、精致的自托管替代方案,适用于本地 AI 模型,具有单一的 Docker Compose 设置、内置网页搜索和 Kokoro TTS,全部采用 MIT 许可证。
Open WebUI 桌面版发布!
Open WebUI 桌面版以原生应用形态登场,无需 Docker 或终端配置即可本地运行 LLM 或连接远程服务器,支持离线运行、系统级语音输入及悬浮聊天窗口。
OpenComputer | 一款为智能体打造的开源计算机
OpenComputer 是一个面向AI智能体的开源虚拟机环境,提供人类可操作的电脑界面,让智能体安全运行的同时,用户能够观察并协作。它可在本地运行并使用小型上下文模型,避免基于截图的导航方式,以提高效率。
Qwen-UI-Agent 技术报告:迈向新一代以真实世界为中心的基座 GUI 智能体
Qwen-UI-Agent 是阿里巴巴 Qwen 团队推出的新基座 GUI 智能体,可处理移动、电脑、网页和 DeepSearch 任务,在移动端使用基准测试上达到最先进性能,在电脑/浏览器任务上取得有竞争力的结果,并在统一动作空间内结合 GUI 与 CLI 动作。
Open Browser Use
Open Browser Use 是一个面向本地AI代理的开源浏览器自动化工具。