标签
一条推文重点介绍了一个使用 kodykoala 和 Cloudflare OS 的管道,该管道可将消耗大量 token 的 AI 技能转化为高效、安全的确定性代码执行。
Sakana AI已发布Namazu API,这是一个更新后的大型语言模型,拥有约1万亿参数,支持实时网络搜索和代码执行,由Modal提供支持。
Modal的首席技术官Akshat Bubna澄清,涉及恶意代理的安全事件是由客户未经身份验证的端点导致的,并非Modal平台隔离遭到破坏。
Claude 订阅包含按任务分配的云虚拟机,可以克隆仓库、安装依赖项并自主运行代码,支持并行任务执行和移动管理。
本线程探讨了如何重新思考MCP(模型上下文协议),使其超越简单的服务集成,突出通用的能力(如搜索和执行),正如Kody所展示的那样,它是一个运行在Cloudflare上的个人助手,任何代理都可以使用。
一条推文强调了 AI 编程助手执行危险命令(如 'rm -rf')的风险,提及了一起事件:由于跳过了权限检查,Codex 删除了 Matt Shumar 的家目录。
Glean 的工程博客详细介绍了他们的新代理框架,该框架通过代码执行实现 100% 程序化工具调用,与标准工具调用相比,减少 24% 的 Token 使用量。该框架通过工具截断和沙箱文件系统管理上下文,适用于长时间运行的复杂工作流。
A speedrunner attempts to execute every byte of the 32KB ROM in Super Mario Bros. using glitches and exploits, covering most of the code including unreachable paths, while documenting the remaining unexecuted bytes.
一位开发者讨论了使用像E2B和Daytona这样的代理沙箱来运行代码执行时的权衡取舍,向社区询问关于生命周期、状态持久化、网络隔离以及托管式与自托管式解决方案的问题。
本文实证分析了基于LLM的程序修复智能体中代码执行的成本效益,发现执行被大量使用但往往不加区分,限制执行可以在对修复成功影响最小的情况下节省大量成本。
llama.cpp的Web UI现在支持通过Web Workers在沙箱iframe中执行模型生成的JavaScript,作为可选功能实现轻量级的代理代码执行。
OpenAI早期员工Lenny Bogdonoff在GPT-4训练和ChatGPT上线前重建了Jupyter代码执行环境,这一工作成为后来'AI电脑'概念的雏形,但当时未受重视。
Greptile 推出 TREX,这是一款能够执行代码并检测运行时错误的 AI 代码审查工具。它超越了静态分析,通过启动并行代理来调查问题并生成截图等产物。
CODA-BENCH 是一个新的基准测试,用于评估代码智能体在数据密集型任务上的表现,弥合了以代码为中心和以数据为中心的评估之间的差距。它包含来自31个社区的超过1000个任务,具有真实的数据规模和噪声,结果显示即使是最顶尖的智能体也仅能达到61.1%的成功率。
objdump -g 中存在一个安全漏洞,由于 FR30 重定位处理程序缺少边界检查,通过精心构造的 FR30 目标文件可实现任意代码执行,单个漏洞利用即可绕过 ASLR 及其他缓解措施。
IDE、AI编码智能体和包管理器的配置文件可以自动执行代码,从而形成供应链安全盲点。本文详细介绍了利用此类配置文件释放恶意软件的Miasma蠕虫攻击,并提供了注入向量的示例。
LangChain推出LangSmith Sandboxes,为每个AI代理提供独立的隔离计算环境以安全执行代码,解决了在容器或本地运行不可信代码的安全风险。
中国发布了OpenSandbox,这是一个面向AI智能体的开源沙箱运行时,支持多种SDK以及通过Docker/Kubernetes隔离的安全执行环境。
LangChain 的新闻通讯宣布了 Interrupt 2026 的重大产品发布:用于自动诊断和修复 Agent 故障的 LangSmith Engine,以及用于安全代码执行的 Sandboxes 正式版,同时还启动了新的 LangChain Labs 研究计划,并预告了即将举行的活动。