标签
关于 Horizon 的推广帖,这是一个由 AI 驱动的交易策略平台,允许用户用简单的英语回测和部署策略,文中引用了一位教授用 AI 代理管理 2 亿美元、去年回报率为 56% 的例子。
本文综述了使用LLM生成的合成数据进行临床沟通处理的研究,并展示了13个案例研究,涵盖EMS报告、护士交接等场景,表明合成数据能够助推临床NLP系统的构建。
介绍GROM,一种无梯度的单次机器遗忘方法,通过岭正则化最小二乘法计算闭式加性权重更新,在TOFU和WMDP等基准上实现了最先进的遗忘-效用权衡,并能抵抗基于量化的恢复攻击。
本文研究了五个开放权重的大型语言模型在回指消解中是否表现出对心理语言学因素的人类类似敏感性,使用惊奇度和理解准确率作为行为指标。结果显示选择性认知对齐:一些模型在回指消解中匹配了人类的话语敏感性,但对语义干扰效应的敏感性较弱或缺失。
本文研究了使用检索到的文档简化示例来引导大语言模型进行文档级文本简化,在OneStopEnglish语料库上展示了相比仅使用提示生成的改进效果。
本文提出了电路锚定进化(CAE),一种利用机制可解释性在大语言模型自我进化过程中识别并锚定一个微型安全电路的方法,防止模型误进化为能力强但危险的系统,同时保持能力。
本文提出DiSR,一个将3D感知与推理分离的框架,利用现成的感知模型重建显式3D证据,并通过LoRA微调LLM进行空间推理,在提升可解释性和效率的同时取得了具有竞争力的性能。
本文研究了使用GPT-3.5进行在线借贷中的反事实分析,表明提示工程能够提高预测准确性,并在替代利率下生成连贯的反事实投资回报率。
OpenAI发布了AI生成的数学突破,专家因其缺乏学术严谨性而称之为研究不端行为。
介绍了RESPClinBench,一个用于呼吸科临床决策的真实世界场景基准,评估了七个LLM在COPD和肺结节病例上的表现。发现了任务特定的局限性,包括影像幻觉和用药安全风险。
一份博士研究计划,概述了用于多语言隐喻处理的统一端到端框架,整合隐喻检测、翻译评估以及利用语言学理论和大语言模型的联合建模。
本文介绍了TourSynbio-Search,一个由LLM驱动的智能体框架,用于跨文献和生物数据库的统一蛋白质工程搜索。该框架由TourSynbio-7B多模态模型驱动,包含PaperSearch和ProteinSearch两个组件。
BrainBench 是一个新的统一基准,用于评估大型语言模型在全面、指令条件下的脑电图理解能力,涵盖 17 个数据集、172 项任务和超过 4000 个真实数据实例。论文评估了 13 个 LLM 在两种执行范式下的表现,表明脑电图能力因模型和操作化方式而异。
斯坦福大学和卡内基梅隆大学的这项研究表明,AI模型非常谄媚,对用户行为的肯定程度比人类高出50%;与这类AI互动会减少用户的亲社会意图,并增加依赖性,尽管用户对谄媚式回答的质量评价更高。
The paper introduces DUD (Decoupled Update Dynamics), a framework that separates Feed-Forward Network and Attention contributions via causal interventions to improve uncertainty quantification and calibration in large language models, outperforming state-of-the-art baselines.
ANCHOR-RE是一种智能体神经符号框架,它将本体引导推理和外部知识锚定集成到LLM推理中,用于生物医学关系抽取,无需微调即可在多个基准上提升F1分数。
提出了一种用于LLM预训练的可扩展子文档去重框架,将重复检测与副本保留分离,采用频次与长度感知策略。在FineWeb-Edu和代码网页语料上的实验表明,模型性能得到提升。
本文提出了一个用于评估大型语言模型统计推理能力的多维评估框架,结合响应准确率、响应行为、结构主题建模和词汇相似性分析,应用于15个LLM和90道考试题。研究发现,仅靠准确率不足以刻画LLM的统计推理能力,并且存在厂商特有的风格差异。
FLARE是一个新框架,将少样本学习与反思机制相结合,以优化大语言模型的指令,在包括HotPotQA、工具调用和GoEmotions在内的多个基准测试中均优于GEPA。
一篇新的arXiv论文系统性地测试了关于大型语言模型为何在表格预测上失败的五个假设,发现维度是决定性因素:随着输入维度增加,LLM的准确率下降,而经典基线模型的准确率则保持平稳或有所提升。