llama

标签

Cards List
#llama

Muse Spark 1.2 开源竟早于 Llama 4 Behemoth!!?

Reddit r/LocalLLaMA · 21小时前

Muse Spark 1.2 即将开源,考虑到大家关注的 Llama 4 Behemoth,这令人意外。作者评论了这一出乎意料的发布顺序。

0 人收藏 0 人点赞
#llama

可检测性边缘的后训练:一种博弈论驱动的微调方法

arXiv cs.LG · 2026-07-30 缓存

本文介绍了一种博弈论的微调语言模型方法,该方法优化了奖励与偏离参考策略之间的权衡,并提供了一种设置KL正则化系数的原则性方法。

0 人收藏 0 人点赞
#llama

@kuriharan: 估计 Llama AI 四分之一的数据来源来自书籍 https://statista.com/chart/36465/estimated-data-source-distributi…

X AI KOLs Timeline · 2026-07-28

Statista 图表估计,Meta 的 Llama AI 模型的训练数据中约有四分之一来自书籍,这凸显了大型语言模型开发中使用的来源构成。

0 人收藏 0 人点赞
#llama

指针增强的自回归生成专利权利要求与联合拓扑和内容解码

arXiv cs.CL · 2026-07-28 缓存

本文提出SPG,一种结构感知的专利生成方法,在自回归解码过程中通过指针头和偏好优化阶段联合预测权利要求拓扑和内容,在HUPD-DCG基准测试中显著提升了父链接恢复和先行词一致性。

0 人收藏 0 人点赞
#llama

原来你的工具调用在某些模型上随机失败的原因并不随机

Reddit r/AI_Agents · 2026-07-25

在16个模型上测试了30种Schema约束后发现,每个提供商都以不同方式处理约束,导致随机的工具调用失败。简单的修复方法:将约束文本移到属性描述中,而不是依赖提示词。

0 人收藏 0 人点赞
#llama

@ylecun: 所以,发布Linux就是倾销?Apache、MySQL、PHP?HTTP、TCP/IP、OpenSSL、OpenSSH?Libjpeg、VLC?开源软…

X AI KOLs Following · 2026-07-19 缓存

Yann LeCun通过列举Linux、Apache、MySQL、PyTorch等重大项目来捍卫开源,质疑“发布它们就是倾销”的说法。

0 人收藏 0 人点赞
#llama

共享子电路使大语言模型跨任务倒数

arXiv cs.CL · 2026-07-15 缓存

本文在Llama-3.1-70B-Instruct中识别出一个'倒数子电路',使模型能够跨各种任务追踪剩余令牌,并证明该子电路在不同上下文甚至不同模型中被复用。

0 人收藏 0 人点赞
#llama

@LottoLabs: Meta停止发布Llama模型真是短视

X AI KOLs Following · 2026-07-04

用户批评Meta停止发布Llama模型的决定,称其短视。

0 人收藏 0 人点赞
#llama

Llama-b9856 Win Cuda 12.4 - Windows Defender 声称其为木马

Reddit r/LocalLLaMA · 2026-07-01

Windows Defender 将运行于 CUDA 12.4 的 Llama-b9856 版本标记为木马,引发安全担忧。

0 人收藏 0 人点赞
#llama

@jerryjliu0:完全解决文档解析包括覆盖准确性、成本和延迟的帕累托曲线上的每一个点:高…

X AI KOLs Timeline · 2026-06-30 缓存

Jerry Liu 提出了一个涵盖准确性、成本和延迟权衡的文档解析框架,介绍了 LiteParse 作为一个面向 AI 智能体循环的开源低延迟解析工具,以及 LlamaParse 用于高精度模式。

0 人收藏 0 人点赞
#llama

Meta一直秘密使用Google的Gemini,后因用量过大被切断访问

Reddit r/artificial · 2026-06-29

Meta曾秘密使用Google的Gemini处理客户服务、广告工具和内容审核,因为其表现优于自家的Llama模型,直至Google因过度使用容量而切断访问。

0 人收藏 0 人点赞
#llama

基于思维树启发的混合方法:使用大语言模型进行法律案件判决摘要生成

arXiv cs.CL · 2026-06-29 缓存

提出一种基于思维树的抽取-生成混合方法,利用大语言模型进行法律案件判决摘要,在DeepSeek和LLama上的实验表明,该方法生成的摘要优于单独的抽取式或生成式方法。

0 人收藏 0 人点赞
#llama

从黑箱到临床洞察:一个用于语音认知障碍检测的多阶段可解释框架

arXiv cs.CL · 2026-06-29 缓存

本文提出一个多阶段可解释框架,结合基于SHAP的词元归因、理论指导的语言特征以及LLaMA-3.1-70B-Instruct大语言模型推理,用于解释基于Transformer的语音模型在认知障碍检测中的表现,取得了良好的临床一致性及高可用性评分。

0 人收藏 0 人点赞
#llama

人工智能中的政治偏见:各大AI模型立场分析

Hacker News Top · 2026-06-25 缓存

对六大主流AI模型的政治倾向分析显示,在经济轴上,其中4个模型偏左,且部分模型未意识到自身的偏见。

0 人收藏 0 人点赞
#llama

Llama基准测试与实际性能差距很大(求助)

Reddit r/LocalLLaMA · 2026-06-18

关于Llama模型基准测试分数与实际性能之间存在显著差距的讨论,作者正在寻求帮助。

0 人收藏 0 人点赞
#llama

@Akashi203: 我开源了 AutoMegaKernel —— 将任意 HuggingFace 模型编译成一个持久的单一兆核,batch-1 解码带宽受限……

X AI KOLs Timeline · 2026-06-17 缓存

AutoMegaKernel 是一个开源代理框架,能将任意 HuggingFace 模型编译成一个持久的单一兆核(megakernel),将整个前向传播融合到一次 GPU 启动中,从而减少开销。在 L4 和 L40S 等推理级 GPU 上,它相比使用 CUDA Graph 的 cuBLAS 实现了最高 1.33 倍的加速,同时保证调度没有死锁和竞争条件。

0 人收藏 0 人点赞
#llama

LLaMA 3.1-8B-Instruct中的框架条件道德计算:伦理推理的机械可解释性审计

arXiv cs.AI · 2026-06-16 缓存

本文使用机械可解释性对LLaMA 3.1-8B-Instruct中的伦理推理进行审计,发现了“情境锚定效应”,即特定领域的表征在道德计算中占主导地位,并提出了“机械对齐”作为研究计划。

0 人收藏 0 人点赞
#llama

@rewind02: 一位斯坦福教授刚刚做了一场公开讲座,详细讲解了GPT、Claude和LLaMA在底层是如何构建的,无需内部权限…

X AI KOLs Timeline · 2026-06-14 缓存

一位斯坦福教授举办了一场公开讲座,全面剖析了GPT、Claude和LLaMA等现代LLM的底层构建方式,让大众也能了解先进的架构。

0 人收藏 0 人点赞
#llama

开源 InfiniteKV:一种 KV 缓存,将旧 token 压缩为 104 字节的可搜索记录存储在内存或磁盘中,而非删除。Mistral-7B 从 token 76,747 处作答,超出其训练窗口 2.3 倍。附 Colab 演示

Reddit r/LocalLLaMA · 2026-06-12

InfiniteKV 是一种开源 KV 缓存技术,将旧 token 压缩为 104 字节的可搜索记录,存储在内存或磁盘中,使模型能够处理超出训练窗口的百万 token 上下文而无需丢弃数据。已验证可与 Mistral-7B 和 SmolLM2 配合使用。

0 人收藏 0 人点赞
#llama

顺序至关重要:LLaMA的序列微调实现连贯的自动化作文评分

arXiv cs.CL · 2026-06-10 缓存

本文研究了使用与话语结构对齐的课程对LLaMA-3.1-8B进行序列微调用于自动化作文评分,结果表明与独立或随机训练相比,连贯性和性能均有提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈