标签
MaSCoD是一个多智能体框架,它在直接边判断前预组织结构假设,以提高候选图生成中潜在相关因果关系的保留率,使用GPT-5.4和GPT-4o在数据集上进行评估。
本研究提出了一个使用Mistral-7B的数字孪生框架,用于模拟社交网络中的观点动态,并通过真实Twitter数据集进行了验证,与经典基线相比,预测准确率提高了超过50%。
CliniCIRCA是一个多阶段LLM框架,用于从非结构化的EHR叙述中重建纵向心理健康患者旅程,无需事件级时间戳即可实现时间分类,并使用临床医生在环评估进行验证。
CDEP Agent 是一个可审计的大型语言模型代理框架,它将气象检测的复合干旱到极端降水事件与现实世界的文档证据相连接,揭示出大多数此类事件在当前报告系统中未被记录。
ATOM是一个开源、自托管的AI智能体平台,旨在通过可控自主和验证结果,帮助AI智能体成功从试点阶段过渡到生产环境。
ASTAR 是一个基于LLM的框架,它能从大规模临床自由文本语料库中自动归纳标准化放射学报告模板,与专家编制的方法相比,减少了人工努力并提高了模板质量。
这篇博客文章介绍了LEVI,一个用于AI驱动系统研究(ADRS)的框架,该框架通过对大多数变异使用较小模型,并保留大型模型用于范式转换,降低了算法发现的成本,实现了3-7倍的成本降低。文章主张将ADRS集成到CI/CD中,以实现每次部署的持续定制优化。
Ax 是一个 JS/TS 库,为 LLM 使用提供高层抽象(签名、智能体、工作流、优化器)。现在引入了 axIR,可以编译成 Python、Java、C++ 和 Go,将相同的编程模型带到多种语言中。
本文介绍了 AHD Agent,这是一个利用代理强化学习(Agentic Reinforcement Learning)的框架,使大型语言模型(LLMs)能够通过动态交互求解环境,自主地为组合优化问题设计启发式方法。
DSPy 3.2.0 优化了 dspy.RLM 的解析、工具执行与故障恢复,并持续推进与 LiteLLM 的解耦。
SwanNLP在SemEval-2026任务5中提出了一个基于LLM的合理性评分框架,用于叙述词义消歧任务。该框架采用结构化推理和动态少样本提示技术,预测短篇故事中词义的人类感知合理性。研究表明,通过少样本提示和模型集成,商用大参数语言模型能够有效复现真实叙述场景中的人类判断模式。
上下文工程的完整参考实现——这是一门设计、检索和向 AI 系统注入组织上下文的学科,用于生成准确的、特定领域的输出。该仓库展示了五个组件(语料库、检索、注入、输出、执行)与 Amazon Bedrock 和 Claude 的整合。