@eglyman:我们训练了一个0.35B参数的模型,在电子表格导航方面比opus 4.6更优秀。普通企业信用卡公司的常规操作。
摘要
一位开发者训练了一个350M参数的模型,其处理电子表格的能力优于Anthropic的Opus 4.6。
我们训练了一个0.35B参数的模型,在电子表格导航方面比opus 4.6更优秀。
普通企业信用卡公司的日常操作。
查看缓存全文
缓存时间: 2026/05/08 09:55
我们训练了一个0.35b参数的模型,在操作电子表格方面表现优于Opus 4.6。
常规企业卡业务操作。
相似文章
@startupideaspod: https://x.com/startupideaspod/status/2069494373604282771
GLM 5.2 是一个开源AI模型,拥有100万token的上下文窗口和强大的基准性能,略逊于Opus 4.8。本集提供了使用Cursor和Codex等工具进行本地或云端部署的实用指南,并强调通过串联模型来实现成本效益。
我不信这个 27B 模型能碾压 Opus 4.5!谁来用真实 Agent 工作流验证一下?
一个 27B 参数的模型据称在基准测试中击败 Opus 4.5,引发社区质疑,大家呼吁用真实 Agent 工作流验证。
VibeThinker: 在推理上击败Opus 4.5的3B参数模型,采用新颖的SFT+GRPO方法
本技术报告介绍了VibeThinker-3B,一个3B参数的密集模型,在AIME26和LiveCodeBench等基准测试上实现了前沿水平的推理性能,通过结合基于课程的SFT、多领域RL和离线自蒸馏,匹配或超越了DeepSeek V3.2和GLM-5等更大的模型。
@FuckAnthropic: 做了对比分析,综合看,DeepSeek V4 Flash-0731 大致是一个 Opus 4.7 - 4.8 之间水平的模型,以极小激活规模进入了前沿 Agent 模型竞争区间,用约 1/12~1/60 的 token 成本进入前沿 Ag…
作者对比分析认为,DeepSeek V4 Flash-0731 在极小激活规模下达到 Opus 4.7-4.8 水平,以极低 token 成本进入前沿 Agent 模型区间,整体超越 GLM-5.2,但短板仍是困难仓库级编程和长时程工程。
一个4b模型现在在网络研究上击败30b模型,原因不在于规模
来自Apodex家族的一个40亿参数开放模型在网页研究基准上优于300亿参数模型,这归因于精心构建的训练数据和自我验证技术,而非原始规模,表明AI能力发展趋向更民主化。