code-execution

标签

Cards List
#code-execution

推理、代码,还是两者兼有?大型语言模型如何处理数学问题的变化

arXiv cs.AI · 2026-05-27 缓存

本文使用 Claude Haiku 4.5 在 1000 个 GSM-Symbolic 问题上评估了三种方法(纯思维链推理、单次代码执行和迭代代码执行),发现思维链对扰动最为鲁棒,而代码执行并未提升小学数学问题的推理鲁棒性。

0 人收藏 0 人点赞
#code-execution

@wsl8297: 做 Agent 最怕的场景,是它把危险命令当正常步骤执行,HOL Guard 就是冲着这个问题来的。 GitHub:https://github.com/hashgraph-online/hol-guard… 官网:https://hol…

X AI KOLs Timeline · 2026-05-23 缓存

HOL Guard 是一个开源安全工具,为 Codex、Claude Code 等开发 Agent 提供危险命令识别、拦截和审计功能,支持多档保护级别和本地审批中心,防止误删改等风险。

0 人收藏 0 人点赞
#code-execution

@larsencc: 如果你运行执行任意代码的智能体:你是隔离工具还是隔离智能体?我们两种都试过了。隔离智…

X AI KOLs Following · 2026-05-22 缓存

讨论在运行执行任意代码的智能体时,是隔离工具还是隔离智能体,结论是隔离智能体更优,因为零秘密和控制平面代理。

0 人收藏 0 人点赞
#code-execution

赋予LLMs exec()能力是一场安全噩梦。我构建了一个基于AST的开源防护机制来阻止恶意代理执行。

Reddit r/AI_Agents · 2026-05-21

介绍ast-guard,一个开源的基于AST的安全工具,它通过将LLM生成的Python字符串解析为抽象语法树,并应用节点级白名单和上下文感知安全检查,防止恶意代码执行。

0 人收藏 0 人点赞
#code-execution

@_philschmid:使用单个curl请求Gemini API构建了一个@github问题分类助手。→ 将仓库克隆到沙箱中 → 获取开放问题…

X AI KOLs Following · 2026-05-21 缓存

使用单个curl请求Gemini API构建了一个GitHub问题分类助手,该助手可以克隆仓库、获取问题、分类问题并执行复现代码以确认错误,且无需任何编排框架。

0 人收藏 0 人点赞
#code-execution

@hwchase17:代码解释器是一个轻量级的代码执行环境,让你可以:- RLMs - 程序化工具调用 - 更多!w…

X AI KOLs Timeline · 2026-05-20 缓存

Harrison Chase 发布了一个名为 code interpreter 的轻量级代码执行环境,它支持 RLMs 和程序化工具调用,无需启动完整的沙箱,更多用例将陆续公布。

0 人收藏 0 人点赞
#code-execution

@huntlovell: https://x.com/huntlovell/status/2057166131924988002

X AI KOLs Timeline · 2026-05-20 缓存

Deep Agents 引入了解释器:小型嵌入式运行时,允许智能体在智能体循环内编写和执行代码,实现多步逻辑和中间状态管理,无需完整的沙箱开销。

0 人收藏 0 人点赞
#code-execution

@_philschmid: 我很兴奋地介绍 Gemini API 中的托管代理。一次 API 调用即可获得一个完整的代理,具备代码执行、网页浏览…

X AI KOLs Following · 2026-05-19 缓存

Phil Schmid 宣布 Gemini API 中的托管代理,支持一次性调用获取包含代码执行、网页浏览和文件管理功能的代理,运行在隔离沙箱中,由 Gemini 3.5 Flash 驱动。

0 人收藏 0 人点赞
#code-execution

让语言模型学会用代码思考

arXiv cs.CL · 2026-05-11 缓存

本文介绍了 ThinC(Thinking in Code,用代码思考)框架。在该框架中,语言模型在简短的自然语言规划步骤后,仅使用代码块进行推理,在数学基准测试中优于现有的工具集成推理基线。

0 人收藏 0 人点赞
#code-execution

@akshay_pachaar: MCP 与 CLI 之争。在 2025 年的大部分时间里,AI 工程师们对此争论不休。怀疑论者摆出了真实数据:- Playwright MCP …

X AI KOLs Following · 2026-05-10

Anthropic 的“代码模式”(Code Mode)重新定义了 MCP 与 CLI 之争。它让 AI 代理编写代码,通过运行时调用工具,而不是将完整的模式加载到上下文中,从而大幅减少了 token 消耗。这种方法结合了 MCP 的强类型契约与懒加载机制,证明了该协议正在演进,而非走向消亡。

0 人收藏 0 人点赞
#code-execution

@akshay_pachaar: https://x.com/akshay_pachaar/status/2053166970166772052

X AI KOLs Timeline · 2026-05-09 缓存

The article discusses a shift in AI agent tool usage from the 'MCP vs CLI' debate to 'Code Mode,' where agents write code to dynamically import tools, significantly reducing context window usage. It highlights Anthropic's approach and Cloudflare's implementation, demonstrating a 98.7% reduction in token consumption for specific tasks.

0 人收藏 0 人点赞
#code-execution

OpenDevin:一个将 AI 软件开发者作为通用代理的开放平台

Papers with Code Trending · 2024-07-23 缓存

OpenDevin 是一个开源平台,用于开发能够通过编写代码、使用命令行以及浏览网页来与环境互动的 AI 代理。该平台支持多种代理、沙箱化代码执行,以及 SWE-Bench 等评估基准。

0 人收藏 0 人点赞
#code-execution

使用 MCP 进行代码执行:构建更高效的智能体

Anthropic Engineering · 2026-05-08 缓存

本文来自 Anthropic,探讨了如何将代码执行与 Model Context Protocol (MCP) 相结合,以提升 AI 智能体的效率。文章分析了工具定义和中间结果导致的 token 过载等挑战,并提出代码执行作为降低延迟和成本的解决方案。

0 人收藏 0 人点赞
← Previous
← 返回首页

提交意见反馈