large-language-models

标签

Cards List
#large-language-models

@antpalkin:一位金融教授用 AI 代理管理着 2 亿美元,他向所有人解释了原因:“大型语言模型在每个领域都达到了四年级博士生的水平……

X AI KOLs Timeline · 2天前 缓存

关于 Horizon 的推广帖,这是一个由 AI 驱动的交易策略平台,允许用户用简单的英语回测和部署策略,文中引用了一位教授用 AI 代理管理 2 亿美元、去年回报率为 56% 的例子。

0 人收藏 0 人点赞
#large-language-models

基于LLM生成的合成数据训练的模型的临床沟通处理:结构化综述与新型应用案例研究

arXiv cs.CL · 2天前 缓存

本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。

0 人收藏 0 人点赞
#large-language-models

GROM:无梯度的快速一次性机器遗忘

arXiv cs.LG · 2天前 缓存

介绍GROM,一种无梯度的单次机器遗忘方法,通过岭正则化最小二乘法计算闭式加性权重更新,在TOFU和WMDP等基准上实现了最先进的遗忘-效用权衡,并能抵抗基于量化的恢复攻击。

0 人收藏 0 人点赞
#large-language-models

大型语言模型中的类人回指消解

arXiv cs.CL · 2天前 缓存

本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。

0 人收藏 0 人点赞
#large-language-models

示例引导的文档级文本简化提示方法

arXiv cs.CL · 2天前 缓存

本文研究了使用检索到的文档简化示例来引导大语言模型进行文档级文本简化,在OneStopEnglish语料库上展示了相比仅使用提示生成的改进效果。

0 人收藏 0 人点赞
#large-language-models

基于电路锚点的安全进化

arXiv cs.CL · 2天前 缓存

本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。

0 人收藏 0 人点赞
#large-language-models

将3D建模与空间推理解耦

arXiv cs.LG · 2天前 缓存

本文提出DiSR,一个将3D感知与推理分离的框架,利用现成的感知模型重建显式3D证据,并通过LoRA微调LLM进行空间推理,在提升可解释性和效率的同时取得了具有竞争力的性能。

0 人收藏 0 人点赞
#large-language-models

基于大语言模型的反事实分析

arXiv cs.AI · 2天前 缓存

本文研究了使用GPT-3.5进行在线借贷中的反事实分析,表明提示工程能够提高预测准确性,并在替代利率下生成连贯的反事实投资回报率。

0 人收藏 0 人点赞
#large-language-models

专家称OpenAI最新数学突破构成研究不端行为

Reddit r/ArtificialInteligence · 3天前 缓存

OpenAI发布了AI生成的数学突破,专家因其缺乏学术严谨性而称之为研究不端行为。

0 人收藏 0 人点赞
#large-language-models

RESPClinBench:呼吸专科护理中多模态临床决策与纵向疾病管理的基准测试

arXiv cs.CL · 3天前 缓存

介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。

0 人收藏 0 人点赞
#large-language-models

迈向端到端多语言隐喻处理:整合检测、翻译与评估

arXiv cs.CL · 3天前 缓存

一份博士研究计划,概述了用于多语言隐喻处理的统一端到端框架,整合隐喻检测、翻译评估以及利用语言学理论和大语言模型的联合建模。

0 人收藏 0 人点赞
#large-language-models

TourSynbio-Search:一种大语言模型驱动的蛋白质工程统一搜索方法智能体框架

arXiv cs.AI · 3天前 缓存

本文介绍了TourSynbio-Search,一个由LLM驱动的智能体框架,用于跨文献和生物数据库的统一蛋白质工程搜索。该框架由TourSynbio-7B多模态模型驱动,包含PaperSearch和ProteinSearch两个组件。

0 人收藏 0 人点赞
#large-language-models

BrainBench:面向全面脑电图理解的大型语言模型基准测试

arXiv cs.AI · 3天前 缓存

BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。

0 人收藏 0 人点赞
#large-language-models

迎合式AI降低亲社会意图并助长依赖性(2025)

Hacker News Top · 4天前 缓存

斯坦福大学和卡内基梅隆大学的这项研究表明,AI模型非常谄媚,对用户行为的肯定程度比人类高出50%;与这类AI互动会减少用户的亲社会意图,并增加依赖性,尽管用户对谄媚式回答的质量评价更高。

0 人收藏 0 人点赞
#large-language-models

DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models

arXiv cs.CL · 4天前 缓存

The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.

0 人收藏 0 人点赞
#large-language-models

ANCHOR-RE:一种用于有依据的生物医学关系抽取的智能体神经符号框架

arXiv cs.CL · 4天前 缓存

ANCHOR-RE是一种智能体神经符号框架,它将本体引导推理和外部知识锚定集成到LLM推理中,用于生物医学关系抽取,无需微调即可在多个基准上提升F1分数。

0 人收藏 0 人点赞
#large-language-models

大规模语言模型预训练中可扩展的频次与长度感知子文档去重

arXiv cs.CL · 4天前 缓存

提出了一种用于LLM预训练的可扩展子文档去重框架,将重复检测与副本保留分离,采用频次与长度感知策略。在FineWeb-Edu和代码网页语料上的实验表明,模型性能得到提升。

0 人收藏 0 人点赞
#large-language-models

超越准确率:大型语言模型统计推理的多维评估

arXiv cs.CL · 4天前 缓存

本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。

0 人收藏 0 人点赞
#large-language-models

FLARE:基于少样本学习的自适应反思引擎

arXiv cs.CL · 4天前 缓存

FLARE是一个新框架,将少样本学习与反思机制相结合,以优化大语言模型的指令,在包括HotPotQA、工具调用和GoEmotions在内的多个基准测试中均优于GEPA。

0 人收藏 0 人点赞
#large-language-models

大型语言模型为何在表格预测上失败

Hacker News Top · 5天前 缓存

一篇新的arXiv论文系统性地测试了关于大型语言模型为何在表格预测上失败的五个假设,发现维度是决定性因素:随着输入维度增加,LLM的准确率下降,而经典基线模型的准确率则保持平稳或有所提升。

0 人收藏 0 人点赞
Next →
← 返回首页

提交意见反馈