标签
Kimi K3 是一个2.8万亿参数的混合专家模型,具有1040亿活跃参数、原生视觉能力和100万token的上下文窗口,在多个领域达到前沿性能,并以开放权重形式发布。
比较了两个用于智能体工作负载的新AI模型:采用循环Transformer架构的紧凑型Nanbeige4.2-3B,以及大型混合专家模型Laguna S2.1,两者均在Hugging Face上发布。
一份泄露的报告称,Z.ai 即将推出的 GLM-5.5 模型拥有超过 1 万亿参数和 100 万 token 的上下文长度,将与 Fable 5 和 Mythos 直接竞争,计划于 8 月发布,并保持开放权重。
Kimi Linear 48B A3B 似乎是一个新的大型语言模型,拥有 480 亿参数,可能来自 Moonshot AI。
Anthropic 发布 Claude Opus 5,这是一款具备增强能力和安全特性的新大型语言模型,如其系统卡片所述。
Anthropic 发布了 Claude 5 Opus 的系统卡,详细介绍了其能力、安全评估以及部署细节。
本文提出了一种检索增强的多智能体LLM框架,结合人在回路机制,用于从临床记录中检测皮肤免疫相关不良事件。与人工审查相比,该框架实现了更高的准确率(F1=0.88 vs 0.77)、更优的评估者间一致性(Cohen's kappa系数为0.82 vs 0.50),并将平均审查时间缩短约一半。
蚂蚁集团发布了Ling-3.0-flash,这是一个124B MoE模型,每个令牌5.1B活跃参数,256K上下文可扩展至1M,在大多数基准测试中匹配或超越其1T旗舰模型。
Arcee AI宣布推出Genesis-Science-1 (GS1),这是一个1万亿参数的开放权重模型,将于今年晚些时候发布。
Poolside 发布 Laguna S 2.1,这是一个 118B MoE 模型,每个 token 激活 8B 参数,针对智能体编码进行了优化。据称,其性能优于 DeepSeek V4 Pro,同时价格低于 DeepSeek V4 Flash,拥有 1M 上下文窗口和开源许可证。
@poolsideai 的新模型 Laguna S 2.1,总参数量118B,活跃参数8B,现已在 Nous Portal 上免费提供两周。
poolside发布了Laguna-S-2.1,一个拥有1200亿参数的新语言模型,在大语言模型领域成为强有力的竞争者。
利用fastjson的0day漏洞测试大模型的漏洞挖掘能力,发现Claude和豆包表现突出。
Debate-on-Graph (DoG) 是一个框架,通过利用带有置信度的不确定知识图谱 (UKG) 增强 LLM 推理,采用启发式搜索和多智能体辩论机制生成可靠答案。在四个 QA 基准测试中达到最先进性能。
Moonshot的Kimi K3是一个2.8万亿参数的开源权重模型,拥有896个专家(每个token激活16个),体现了在保持活跃计算不变的情况下扩大总参数的趋势,并使用注意力压缩来减少KV缓存大小,使得前沿推理更容易实现,但存储成本较高。
Motif Technologies 发布了 Motif-3 的中期测试版检查点,这是一个大规模混合专家语言模型,总参数约 314B(激活约 13B),上下文长度 256K,并采用自定义架构如分组差分潜在注意力(GDLA),公开可用于非商业研究。
一个744B参数的混合专家模型在25GB内存的笔记本电脑上启动,通过将专家权重存储在SSD上,每个词元仅加载活跃的约400亿参数,使得尽管模型庞大,仍能进行本地推理。
本文介绍了一种知识中心型框架,用于生成ComfyUI工作流,该框架从真实工作流中提炼层次化知识(伪代码、骨架、策略),并利用大语言模型(LLM)执行从任务描述到可执行结构的推理,实现了更高的节点多样性和执行成功率。
Qwen3.8 是一个 2.4 万亿参数的语言模型,由阿里巴巴以开源权重形式发布,预览版可在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上获取。