标签
一位用户分享了一个观察:Qwen 和 Gemma 对代码的分词方式非常不同,对于相同的 HTML/JS 输入,Qwen 使用的 token 数量远少于 Gemma,这可能解释了它们在编程和语言任务上的表现差异。他们还提到了 LiquidAI 的一个可能使用更高效分词器重新训练模型的项目。
一篇博客文章认为,常说的"代码从来都不是难的部分"这句话是对程序员的侮辱,它捍卫了编码的难度,并对过度强调需求收集提出了质疑。
据传OpenAI新模型Astra在编程能力上取得突破,但因其能力过强可能带来网络攻击风险,发布被延期。
Carson Gross 在演讲中讨论了 AI 对大学计算机科学教育的影响,认为在 AI 时代仍需教学生写代码和读代码,同时指出 AI 带来了评估危机和教学变革的机会。
BigBang-v1 是来自上海 Endless Frontier Lab 的自我进化 36B 大语言模型,使用 AI 生成的前沿任务进行训练,仅用 10K 个高质量示例就在科学、编码、工具使用和长上下文方面取得了强劲表现。
这是一场讨论,质疑在 Kimi K3、Qwen 3.8 Max 和 DeepSeek V4 Pro 等新模型陆续推出后,GLM 5.2 和 Kimi 2.7 等旧 AI 模型是否仍对编程具有重要意义。
Yohei Nakajima 描述了他升级自己的 AI 智能体技术栈,从而可以在任何地方解放双手工作;由幕僚长将任务分配给各项目经理和执行者,所有协调都通过仓库进行。
Meta 发布了 Muse Code,这是一款处于测试阶段的终端 AI 编码智能体,可处理大型代码库中的复杂软件工程任务,与 OpenAI 的 Codex 和 Anthropic 的 Claude Code 展开竞争。
Prime Intellect 推出了 Prime Agent,一个用于编程和长期自主任务的自我改进型 RLM 框架,具备程序化工具调用、将上下文作为变量、多智能体消息传递以及可自我修改的框架状态等特点。
Ling-3.0-flash MXFP4 是一款量化模型,已发布并可在单个 DGX Spark 上本地运行,实现约 80 tok/s 的解码速度和 2,500–3,500 tok/s 的长输入预填充速度,从而为编码、智能体和离线批处理任务提供私有的设备端推理。
AI 充当了一位耐心、全天候的私人导师,解释概念、调试代码,并一步步指导学习者,不带任何评判,从而让学习编程变得容易得多。
用户在本地编码基准测试中对 DeepSeek v4 Flash 与 Qwen3.6-27B、Qwen3.5-122B 和 Gemma 4 31B 进行了对比,发现 Flash 总体胜出,但 Qwen 122B 表现惊人,首次尝试成功率更高且 token 消耗更低。
Epoch AI 和 METR 推出了 MirrorCode,这是一个基准测试,用于测试 AI 模型在长时间跨度内端到端重新实现整个程序的能力。早期结果显示,Claude Opus 4.7 在 14 小时内解决了一个生物信息学工具包,花费 251 美元,但记忆化方面的注意事项仍然存在。
Qwen3.8-Max 是一款 2.4T 参数的开源权重模型,在基准测试中与 Kimi K3 和 DeepSeek V4 Flash 表现持平,在编码和软件任务上尤为出色。权重将于下周发布,定价为输入 $2/百万 tokens、输出 $6/百万 tokens。
AI9Stars 发布了 G9v3-39A5B,这是一个开放权重的 39B MoE 语言模型,拥有 5 个活跃专家,面向推理、编码和助手任务,采用 Apache 2.0 许可。
阿里巴巴发布 Qwen3.8-Max,一个 2.4T 参数的 MoE 前沿模型,开放权重将于下周推出,声称自主运行16天,成本显著低于 GPT-5.6 Sol 和 Claude Fable 5。
对软件工程中“AI生产率差距”的分析,认为AI主要加快了开发人员工作中编码部分的速度,而设计、评审和会议等其他关键任务基本未变,导致整体收益仅略有提升。报告还指出,初级员工比高级员工受益更多,这与一些领导者的假设相反。
一条推文调侃道,Anthropic 在发布强大 AI 时小心翼翼,而 Qwen 却发布了用于编程和协作的新模型 Qwen3.8-Max,并请用户给他们的仓库点星。
Qwen 3.8-Max 正式版发布,视频演示了千问办公和 Qwen Code 工具,主打编程与协同办公能力。