标签
This paper introduces CHORUS, a post-training framework that uses staged supervised fine-tuning and reinforcement learning to create complementary expert models, which are then merged or distilled into a single 4B model that achieves 88.0% Pass@1 on the CVDP-ECov testbench stimulus generation benchmark, outperforming DeepSeek-R1.
本文介绍ZhuLong,一个面向EDA脚本编写的执行落地LLM编码代理。它通过MCP工具实现API检索、文档检查和沙箱执行,并辅以离线API自我探索机制来推断未记录的API行为。在包含158个真实EDA任务的基准测试上,ZhuLong达到了78.5%的Pass@1,显著优于纯LLM基线。
Mistral 已获得一项专利,该方法使用 LLM 生成封装工具调用的代码块,在沙盒中执行,并在需要时暂停以等待客户端结果。
有用户报告称,Muse Glimmer 拒绝编写鼠标控制代码,理由是安全问题,即使是为了合法的调试任务也是如此。
本预印本对LLM评审团的聚合独立性指标提出质疑,表明验证信号仅在关键的“一票之差”查询上提升准确率,并提出一种按票数差距分层的调用缩减规则。
WebGrader是一篇研究论文,介绍了一种自进化的程序化评分器,它将交互流程推导为可执行的契约,从而为LLM的Web开发实现强化学习。它在基准测试上提高了功能成功率,并超越了多个强基线。
Matt Pocock 指出,Opus 5 生成高质量代码,自主编码运行依然强劲,尽管人在环路规划变得令人烦恼。
作者吐槽当前AI模型普遍有过度添加注释的倾向,导致过时信息被注入代码上下文,且由agent自主完成,存在失控风险。
Simon Willison 通过 Codex Desktop 测试 GPT-5.6 Sol Ultra,要求其根据一个四年前的提示重新制作“Raccoon Heist”游戏,结果比 Claude Fable 5 的版本好得多,但存在眼球过大的 bug。
作者在真实自由职业项目中测试了六款AI应用构建器,发现只有Cursor + Claude和v0 + 手动实现能可靠交付生产级应用,其他工具因平台锁定和可维护性问题而落败。
关于 Artificial Analysis 如何在 SciCode 基准测试中将 Gemma 4 排在 Qwen3.6 27b 之上的讨论,质疑该排名是否反映现实世界的编码能力,还是揭示了基准测试的问题。
用户确认复现了一个热门的提示词,该提示词可以一次性生成像《使命召唤》和《FIFA》这样的完整游戏,甚至还与10岁的侄子一起对游戏进行了迭代进化。Matt Shumer 的原始推文重点介绍了该仓库和提示词。
介绍 Flex,这是一个新的 DSPy 模块,让语言模型重写程序代码本身,而不仅仅是提示词,从而实现更好的优化、更少的模型调用以及通过沙箱实现更安全的执行。
Meta 发布了 Muse Code,这是一款处于测试阶段的终端 AI 编码智能体,可处理大型代码库中的复杂软件工程任务,与 OpenAI 的 Codex 和 Anthropic 的 Claude Code 展开竞争。
Flex 是 DSPy 的一个新功能,优化器可以用确定性代码替换 LLM 调用,有时在大幅减少所需 LLM 调用次数的同时提高准确性。
Booz Allen 的一篇论文声称,当提示涉及美国政府或台湾独立等政治敏感的中国话题时,中国大语言模型生成的代码会包含更多漏洞。该推文讨论了这一发现,提到了一篇类似的 CrowdStrike 博客,并呼吁进行更多研究。
在成本降低 80% 后,Theo 称赞了 Luna 的性价比,称其几乎免费且能够进行真正的数据处理,并计划在 T3 Code 中更多地使用它来生成标题。
Microsoft AI Frontiers推出了Web Skill Factory,这是一个将已解决的网络任务转换为可复用、已验证代码程序的流水线。在WebArena子集上使用gpt-5.4重用该库,将保留实例的准确率从55%提升至70%,并将平均步骤从17.1减少到14.7。
作者构建了一个开源 AI Agent Skill,它可以扫描项目并生成 README、LICENSE、CONTRIBUTING 等文档文件,提供分级方案和针对项目定制的内容,避免使用通用占位符。
bolt.new 正在推出一个免费的安全工程师代理,它在六个安全类别中对应用进行深度扫描,并在修复与部署之间加入构建验证,旨在缩小由更快的 AI 代码生成所带来的安全差距。