large-language-model

标签

Cards List
#large-language-model

@rohanpaul_ai: 阿里巴巴发布了Qwen3.8-Max,一个2.4万亿参数模型,每个token仅激活约950亿参数。一个……

X AI KOLs Timeline · 21小时前 缓存

阿里巴巴发布了Qwen3.8-Max,这是一个2.4万亿参数的稀疏MoE模型,每个token激活950亿参数,支持100万token的上下文,并具有强大的智能体能力和基准测试结果,包括自主编码数天、电路设计,以及在Terminal Bench和PaperBench上超越竞争对手。

0 人收藏 0 人点赞
#large-language-model

字节跳动处于训练参数多达10万亿的模型的早期阶段

Reddit r/singularity · 昨天

字节跳动正在早期阶段训练一个参数多达10万亿的大语言模型,标志着AI开发的大规模扩展。

0 人收藏 0 人点赞
#large-language-model

Gemini

Reddit r/singularity · 昨天

谷歌的Gemini AI模型代表了多模态AI能力的重大进步。

0 人收藏 0 人点赞
#large-language-model

K-EXAONE 2.0 Technical Report

arXiv cs.CL · 2天前 缓存

LG AI Research presents K-EXAONE 2.0, a 750B-parameter MoE foundation model upcycled from K-EXAONE, supporting 256K context and six languages, with self-speculative decoding for efficient inference.

0 人收藏 0 人点赞
#large-language-model

激活引导的神经元干预在大型语言模型中诱导阿尔茨海默病相关计算语言表型

arXiv cs.CL · 3天前 缓存

本文介绍了一种使用Qwen3-8B的激活引导神经元干预框架,用于诱导阿尔茨海默病相关的计算语言表型,证明放大与AD相关的神经元会在多个认知领域产生分级损伤。

0 人收藏 0 人点赞
#large-language-model

@ChiragAsarpota: 兄弟,这对开放模型来说太巨大了 连Qwen终于也屈服了,正在开放Max模型的权重。他们从未开放过任何M…

X AI KOLs Timeline · 5天前 缓存

Qwen宣布,拥有2.4万亿参数的Qwen3.8-Max将于下周以开放权重的方式发布,同时发布的还有Qwen3.8-27B,这标志着开源AI的一次重大推进,并可能使其与顶级专有模型一较高下。

0 人收藏 0 人点赞
#large-language-model

面向多模态情感分析的语义对齐结构抽象

arXiv cs.CL · 2026-07-31 缓存

本文提出了SentiLLM,一个利用语义对齐结构抽象将非语言模态提炼为类文本标记的框架,用于基于大语言模型的多模态情感分析。它引入了一种双流显著性-上下文校准机制,并在四个数据集上取得了优越的性能。

0 人收藏 0 人点赞
#large-language-model

有人试过Q1 Kimi K3吗?(555GB)

Reddit r/LocalLLaMA · 2026-07-29 缓存

Kimi K3是一个庞大的2.9万亿参数混合专家模型,拥有1040亿活跃参数,100万上下文长度,原生支持MXFP4训练,现已提供从540GB到更小尺寸的GGUF量化版本,但运行需要强大的硬件。

0 人收藏 0 人点赞
#large-language-model

@_akhaliq: A.X K2 刚刚在 Hugging Face 上发布 大规模稀疏MoE (688B / 33B 激活参数) https://huggingface.co/skt/A.X-K2

X AI KOLs Following · 2026-07-29 缓存

SKT 在 Hugging Face 上发布了 A.X K2,一个 688B 参数的稀疏 MoE 语言模型,拥有 33B 激活参数,原生采用 FP8 训练,并具备 Think/Non-Think 推理模式。

0 人收藏 0 人点赞
#large-language-model

@interjc: 期待 Grok 4.6,内卷才能有更多重置

X AI KOLs Following · 2026-07-29 缓存

埃隆·马斯克宣布Grok 4.6将于8月7日左右发布,这是一个1.5T参数的模型,经过改进的SFT和RL;随后几周将发布更好的Grok 4.7(2.1T参数)。

0 人收藏 0 人点赞
#large-language-model

@elonmusk: 有意思。Grok 4.6 将于8月7日左右发布。这将是一个1.5T参数的模型,显著改进了SFT与RL。Grok…

X AI KOLs Timeline · 2026-07-28 缓存

Elon Musk宣布,Grok 4.6将于8月7日左右发布,采用1.5T参数模型并改进了SFT与RL,随后将推出2.1T参数的Grok 4.7。

0 人收藏 0 人点赞
#large-language-model

@seclink: 官方页面地址: https://huggingface.co/moonshotai/Kimi-K3… 这是 Moonshot AI(月之暗面)发布的 2.8 万亿参数(MoE 架构,激活约 104B)开源权重模型,支持原生多模态(文本+图…

X AI KOLs Timeline · 2026-07-28 缓存

Moonshot AI releases Kimi K3, a 2.8 trillion parameter open-weight MoE model with native multimodal capabilities and a 1 million token context window, claiming it as the world's first open 3T-class model.

0 人收藏 0 人点赞
#large-language-model

发布 Kimi K3 模型权重和技术报告(2分钟阅读)

TLDR AI · 2026-07-28 缓存

Kimi Moonshot 发布了 Kimi K3,这是一个 2.8 万亿参数的多模态模型,拥有 100 万 token 的上下文窗口,以及 Kimi Delta Attention 和 Attention Residuals 等架构创新。公司声称其效率显著提升,在内部基准测试中超越了 Claude Opus 4.8 和 GPT-5.5。

0 人收藏 0 人点赞
#large-language-model

moonshotai/Kimi-K3

Simon Willison's Blog · 2026-07-27 缓存

Moonshot发布了他们的2.8万亿参数模型Kimi K3的权重,采用了一种修改后的许可证,要求大型商业Model-as-a-Service企业另行签订协议。

0 人收藏 0 人点赞
#large-language-model

Kimi K3 现已通过 Telnyx Inference API 提供

Hacker News Top · 2026-07-27 缓存

Kimi K3 是 Moonshot AI 推出的 2.8 万亿参数的开源模型,支持 100 万 token 上下文和原生视觉能力,现已上线 Telnyx Inference API,适用于编码、推理和多模态等任务。

0 人收藏 0 人点赞
#large-language-model

Kimi-K3 技术报告 [pdf]

Hacker News Top · 2026-07-27 缓存

MoonshotAI发布了Kimi-K3,一个拥有2.8万亿参数的开源权重多模态智能体模型,具备100万token的上下文窗口,基于全新的Kimi Delta Attention和Attention Residuals架构,实现了显著的扩展性改进。

0 人收藏 0 人点赞
#large-language-model

@levie: k3 模型权重已到达

X AI KOLs Timeline · 2026-07-27 缓存

Kimi.ai 发布了 Kimi K3 的模型权重和技术报告,这是一个 2.8T 参数的 MoE 模型,具有原生视觉理解和 1M token 上下文窗口,声称每单位计算智能提升 2.5 倍。

0 人收藏 0 人点赞
#large-language-model

@AdinaYakup: @Macaron0fficial 的 Macaron V1 推出两个变体:Venti:748B 旗舰(744B 基础 + 4×1B LoRA 专家)。后续……

X AI KOLs Following · 2026-07-27 缓存

Macaron V1 发布两个变体:Venti(748B 旗舰,配备 4×1B LoRA 专家)和 Tall(50B 本地部署,配备 4×3.7B LoRA 专家),分别基于 GLM-5.2 和 Qwen 3.6 进行后训练。

0 人收藏 0 人点赞
#large-language-model

Kimi K3 是迄今为止发布的最大开源权重模型,但你仍然无法运行它。

Reddit r/AI_Agents · 2026-07-27

Moonshot 发布了最大的开源权重模型 Kimi K3(2.8 万亿参数),拥有出色的基准测试成绩,但自托管需要巨大硬件,对大多数用户而言,API 接入是更实际的选择。

0 人收藏 0 人点赞
#large-language-model

Ornith-397B 在单张 RTX PRO 6000 Blackwell 96GB 上以 Q4 运行 - 预填充 2,354 tok/s,解码约 20–24 tok/s

Reddit r/LocalLLaMA · 2026-07-27

Krasis 是一个专注于 MoE 的运行时,通过动态管理 VRAM 中的专家驻留,能够在一张 RTX PRO 6000 Blackwell 96GB GPU 上以约 20-24 tok/s 的解码速度运行 397B 参数的 Ornith 模型。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈