code-generation

标签

Cards List
#code-generation

CHORUS: Complementary Experts for High-Coverage Testbench Stimulus Generation

arXiv cs.AI · 7小时前 缓存

This paper introduces CHORUS, a post-training framework that uses staged supervised fine-tuning and reinforcement learning to create complementary expert models, which are then merged or distilled into a single 4B model that achieves 88.0% Pass@1 on the CVDP-ECov testbench stimulus generation benchmark, outperforming DeepSeek-R1.

0 人收藏 0 人点赞
#code-generation

ZhuLong:面向EDA脚本的执行落地LLM代理,具备离线API自我探索能力

arXiv cs.AI · 昨天 缓存

本文介绍ZhuLong,一个面向EDA脚本编写的执行落地LLM编码代理。它通过MCP工具实现API检索、文档检查和沙箱执行,并辅以离线API自我探索机制来推断未记录的API行为。在包含158个真实EDA任务的基准测试上,ZhuLong达到了78.5%的Pass@1,显著优于纯LLM基线。

0 人收藏 0 人点赞
#code-generation

Mistral 关于“代码实现的工具调用”的专利

Hacker News Top · 昨天 缓存

Mistral 已获得一项专利,该方法使用 LLM 生成封装工具调用的代码块,在沙盒中执行,并在需要时暂停以等待客户端结果。

0 人收藏 0 人点赞
#code-generation

Glimmer 似乎被审查得很厉害?

Reddit r/LocalLLaMA · 昨天

有用户报告称,Muse Glimmer 拒绝编写鼠标控制代码,理由是安全问题,即使是为了合法的调试任务也是如此。

0 人收藏 0 人点赞
#code-generation

关键投票盲点:聚合独立性指标忽略了验证真正有助益的场景

arXiv cs.AI · 2天前 缓存

本预印本对LLM评审团的聚合独立性指标提出质疑,表明验证信号仅在关键的“一票之差”查询上提升准确率,并提出一种按票数差距分层的调用缩减规则。

0 人收藏 0 人点赞
#code-generation

WebGrader:使用自进化程序化评分器训练LLM进行Web开发

arXiv cs.AI · 2天前 缓存

WebGrader是一篇研究论文,介绍了一种自进化的程序化评分器,它将交互流程推导为可执行的契约,从而为LLM的Web开发实现强化学习。它在基准测试上提高了功能成功率,并超越了多个强基线。

0 人收藏 0 人点赞
#code-generation

@mattpocockuk: Opus 5 被低估的一点是,它生成的代码实际上很出色。我的 AFK 运行完全没有退化,j…

X AI KOLs Timeline · 3天前 缓存

Matt Pocock 指出,Opus 5 生成高质量代码,自主编码运行依然强劲,尽管人在环路规划变得令人烦恼。

0 人收藏 0 人点赞
#code-generation

@jakevin7: 现在的模型感觉都有点大病,得了注释狂魔症.... 会导致很大问题,很多过时的信息被注入到代码里作为上下文,并且这还是agent自主做的不可控的。

X AI KOLs Following · 4天前

作者吐槽当前AI模型普遍有过度添加注释的倾向,导致过时信息被注入代码上下文,且由agent自主完成,存在失控风险。

0 人收藏 0 人点赞
#code-generation

Moonlight & Mayhem (Raccoon Heist by Codex + GPT-5.6 Sol Ultra)

Simon Willison's Blog · 4天前 缓存

Simon Willison 通过 Codex Desktop 测试 GPT-5.6 Sol Ultra,要求其根据一个四年前的提示重新制作“Raccoon Heist”游戏,结果比 Claude Fable 5 的版本好得多,但存在眼球过大的 bug。

0 人收藏 0 人点赞
#code-generation

我在真实客户项目中测试了6款AI应用构建器,仅2款通过生产环境考验

Reddit r/ArtificialInteligence · 4天前

作者在真实自由职业项目中测试了六款AI应用构建器,发现只有Cursor + Claude和v0 + 手动实现能可靠交付生产级应用,其他工具因平台锁定和可维护性问题而落败。

0 人收藏 0 人点赞
#code-generation

为什么 artificialanalysis.ai 在 SciCode 上将 Gemma4 排在 Qwen3.6 27b 之上

Reddit r/LocalLLaMA · 5天前

关于 Artificial Analysis 如何在 SciCode 基准测试中将 Gemma 4 排在 Qwen3.6 27b 之上的讨论,质疑该排名是否反映现实世界的编码能力,还是揭示了基准测试的问题。

0 人收藏 0 人点赞
#code-generation

@acherm: 我确认。我用相同的提示词复现了两次,一次得到 CallOf 的变体,另一次是一个类似 FIFA 的游戏。还…

X AI KOLs Following · 6天前 缓存

用户确认复现了一个热门的提示词,该提示词可以一次性生成像《使命召唤》和《FIFA》这样的完整游戏,甚至还与10岁的侄子一起对游戏进行了迭代进化。Matt Shumer 的原始推文重点介绍了该仓库和提示词。

0 人收藏 0 人点赞
#code-generation

介绍 Flex:让模型编写代码(16 分钟阅读)

TLDR AI · 6天前 缓存

介绍 Flex,这是一个新的 DSPy 模块,让语言模型重写程序代码本身,而不仅仅是提示词,从而实现更好的优化、更少的模型调用以及通过沙箱实现更安全的执行。

0 人收藏 0 人点赞
#code-generation

Meta 推出 Muse Code,一款面向大型代码库的 AI 智能体

TechCrunch AI · 6天前 缓存

Meta 发布了 Muse Code,这是一款处于测试阶段的终端 AI 编码智能体,可处理大型代码库中的复杂软件工程任务,与 OpenAI 的 Codex 和 Anthropic 的 Claude Code 展开竞争。

0 人收藏 0 人点赞
#code-generation

@MaximeRivest:Flex 是 dspy 的一个新想法,优化器可以(除其他外)用确定性(廉价)代码替换 AI 调用……

X AI KOLs Following · 6天前 缓存

Flex 是 DSPy 的一个新功能,优化器可以用确定性代码替换 LLM 调用,有时在大幅减少所需 LLM 调用次数的同时提高准确性。

0 人收藏 0 人点赞
#code-generation

Booz Allen 关于中国大语言模型生成易受攻击代码的论文

Reddit r/ArtificialInteligence · 6天前

Booz Allen 的一篇论文声称,当提示涉及美国政府或台湾独立等政治敏感的中国话题时,中国大语言模型生成的代码会包含更多漏洞。该推文讨论了这一发现,提到了一篇类似的 CrowdStrike 博客,并呼吁进行更多研究。

0 人收藏 0 人点赞
#code-generation

@gdb: Luna 的性价比令人难以置信

X AI KOLs Following · 2026-08-04 缓存

在成本降低 80% 后,Theo 称赞了 Luna 的性价比,称其几乎免费且能够进行真正的数据处理,并计划在 T3 Code 中更多地使用它来生成标题。

0 人收藏 0 人点赞
#code-generation

@ms_aifrontiers:今天我们将介绍Web Skill Factory:一个将已解决的网络任务转化为可复用、已验证代码的流水线。大多数智…

X AI KOLs Following · 2026-08-04 缓存

Microsoft AI Frontiers推出了Web Skill Factory,这是一个将已解决的网络任务转换为可复用、已验证代码程序的流水线。在WebArena子集上使用gpt-5.4重用该库,将保留实例的准确率从55%提升至70%,并将平均步骤从17.1减少到14.7。

0 人收藏 0 人点赞
#code-generation

我构建了一个 AI Agent Skill,通过分析你的项目生成所有开源文档(README、LICENSE、CONTRIBUTING 等 20 多种)

Reddit r/AI_Agents · 2026-08-04

作者构建了一个开源 AI Agent Skill,它可以扫描项目并生成 README、LICENSE、CONTRIBUTING 等文档文件,提供分级方案和针对项目定制的内容,避免使用通用占位符。

0 人收藏 0 人点赞
#code-generation

@rohanpaul_ai:更快的代码生成也会提高不安全假设进入生产环境的速度。但仅靠更多扫描……

X AI KOLs Following · 2026-07-31 缓存

bolt.new 正在推出一个免费的安全工程师代理,它在六个安全类别中对应用进行深度扫描,并在修复与部署之间加入构建验证,旨在缩小由更快的 AI 代码生成所带来的安全差距。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈