标签
本文介绍了一种用于LLM智能体的确定性验证框架,以防止shell命令和代码编辑中的静默故障,展示了高捕获率,并发布了基准测试和验证器。
作者在125k个自然语言/命令对上微调了Qwen2.5-Coder-1.5B,以生成shell命令,在笔记本电脑CPU上本地运行约1秒,并发布了权重和代码。
分享两种Claude Hook的用法:被动观察记录工具调用日志,以及主动干预实现学习模式状态机。强调Hooks作为硬约束比提示词更可靠。
rtk 库通过压缩 shell 命令输出来减少 token 消耗,在两周内为编码代理节省了 250 万个 token。
GrepSeek 训练大型语言模型搜索代理,使其能够通过使用 grep 等 shell 命令直接与文本语料库交互。它采用两阶段训练流程:冷启动数据集构建和 GRPO 微调,在开放域问答基准测试中取得了优异的 F1 和 Exact Match 分数。
在OpenClaw中使用Cron任务和Heartbeat的技巧,以提高效率并减少token使用量,附各适用场景示例。