@neural_avb: 发布最新版 fast-rlm,让你的 LLM 在 RLM 框架中运行,在 REPL 内探索海量上下文…
摘要
fast-rlm 是一个开源的 Python 工具,允许 LLM 在 RLM 框架中运行,以进行递归子代理调用,并具备支出限制和实时日志流等功能。
查看缓存全文
缓存时间: 2026/07/02 18:25
发布最新的 fast-rlm
fast-rlm 让您的 LLM 能够在 RLM 框架内工作,在 REPL + 沙箱 + 递归调用子智能体的环境中探索大规模上下文。支持工具和子智能体级别的结构化 IO。
新特性:
- 真正能停止运行的费用限制。您只需为 RLM 调用设定一个软预算(以美元计),它就会遵守。
- 实时逐步流式输出日志。非常适合您的编码智能体监控 RLM 运行并“实时”报告结果。
- 更多修补:更好的日志记录、事件监听器、显式 KV 缓存命中(针对 Anthropic 模型),以及更好的默认起始设置。
Fast RLM 可通过 pip 安装,仓库开源且采用 MIT 协议。
相似文章
@neural_avb: RLMs 现在可以通过 `fast-rlm` 访问 MCP 服务器 - 通过 stdio 或 http 连接任意 MCP - RLM 可访问所有 MCP 工具、资…
fast-rlm 使强化学习模型能够通过 stdio 或 HTTP 访问 MCP 服务器,允许使用工具和获取资源,结果保存为 REPL 中的 Python 变量以节省输入令牌。
@neural_avb: 最酷的 RLM 轨迹之一,让我直呼“哇哦”——RLMs(Minimax M3)启动带有清晰 p… 的子代理群
Neural_avb 强调 Minimax M3 的 RLM 如何使用带有 pydantic 契约的子代理群进行类型检查和模式验证,从而降低幻觉率和失败的子代理调用。
@TDataScience:跟随@neural_avb的全方位深度解析,了解“递归语言模型(RLM)是什么、为何它们会在长上下文基准测试中持续胜出……”
一篇关于递归语言模型(RLM)的教育性深度文章,解释了RLM是什么、为何它们能在长上下文基准测试中胜出,以及它们与现有智能体框架(如ReAct或CodeAct)的不同之处,并通过一个简单的案例研究进行说明。
@neural_avb: 用我的 SLM 在本地生成类似 GRPO 的 rollout,并用这个微型 RM 作为评分标准。接下来我将在…
Neural_avb 发布了一个轻量级的 Answer-eq 奖励模型,用于问答任务的强化学习训练,声称与外部评判 LM 的一致性达到 80%,且比 F1/ROUGE/BertScore 更快。
@ethantsliu:meta-rl 引发代理式 LLM 探索 传统强化学习训练 LLM 代理使用固定策略,难以进行主动探索……
一篇新的研究论文将 LLM 代理训练重新定义为跨回合的 Meta-RL 问题,使用无评论家策略梯度实现在上下文中的适应,而无需梯度更新。LAMER 框架在长时程任务上相比标准 RL 基线将测试时性能提升了 11-19%,并且能更好地泛化到未见过的环境。