Solar Intelligence
摘要
本文介绍了Solar Intelligence,一个混合检索增强框架,它统一了太阳能数据分析、基于证据的科学问答和机器学习预测,以支持太阳能领域的决策制定。
arXiv:2609.13648v1 公告类型:新
摘要:太阳能决策支持分散在仅提供数据而不作解释的仪表板中,研究论文解析缓慢,且通用语言模型并非针对太阳能领域,回答缺乏证据。本文介绍了Solar Intelligence,一个混合检索增强框架,它在系统中统一了结构化太阳能分析、基于证据的科学问答和机器学习预测。该平台集成了每日NASA POWER太阳能和气象数据、Biosphere 2地面传感器读数以及精选的研究论文和机构报告语料库。结构化查询使用DuckDB SQL;科学问题由混合检索器回答,该检索器通过互惠排名融合融合了BM25和ChromaDB密集嵌入,响应通过语言模型(llama3.2:3b)进行基于证据的处理。极端梯度提升(XGBoost)模型生成每日的辐照度、温度和风速预测。系统通过FastAPI、Streamlit和MCP服务器暴露,因此可以作为应用程序、API服务或代理工具使用——适用于学生、研究人员和能源分析师。
查看缓存全文
缓存时间: 2026/09/15 08:58
# 太阳能智能系统 来源:https://arxiv.org/html/2609.13648 Jyotsna Singh††感谢:[jsinghenv@gmail\.com](mailto:[email protected]) ###### 摘要 太阳能决策支持体系目前呈现碎片化状态:各类数据仪表板提供数据却缺乏解释,学术论文解析耗时,而通用语言模型缺乏太阳能领域专业知识且回答常缺乏实证依据。本文推出“太阳能智能系统”,一个混合检索增强框架,集结构化太阳能分析、基于实证的科学问答与机器学习预测于一体。该平台整合了NASA POWER每日太阳能与气象数据、生物圈2号地面传感器读数,以及精选的研究论文与机构报告语料库。结构化查询通过DuckDB SQL实现;科学问题由混合检索器处理,该检索器采用互惠排序融合技术结合BM25与ChromaDB稠密嵌入,并通过语言模型(llama3.2:3b)生成基于证据的回答。极端梯度提升(XGBoost)模型则提供辐照度、温度和风速的每日预测。系统通过FastAPI、Streamlit和MCP服务器对外提供服务,学生、研究人员和能源分析师可将其作为应用程序、API服务或智能工具使用。 关键词:太阳能、科学问答、检索增强生成、BM25、预测、XGBoost、NASA POWER、生物圈2号 ## 1引言 太阳能领域的可靠决策需要领域知识、最新研究、可理解现状的数据以及预测未来的分析。这种完整组合使用户能够进行全方位评估,从而规划、组织和维护太阳能系统。太阳能系统安装规划需考虑长期辐照度变化、季节性趋势和异常模式检测(Segado‑Moreno等人,2026;Singh与Kumar,2016;Wild等人,2009)。科学家与研究人员已构建了从经验公式到机器学习的各类模型,用于预测全球(Fohagui等人,2026;Voyant等人,2014)及散射太阳辐射(Appelbaum与Peled,2026;Atsbeha等人,2025;Singh等人,2013)。光伏系统数据也被用于分析系统发电特性(Ouyang等人,2025;Singh等人,2017)。 尽管众多数据仪表板、预测服务和大语言模型已在助力太阳辐射研究,但它们彼此割裂,这种碎片化延缓了研究进程与决策效率。从研究论文和报告中整合知识耗时费力,传统统计和机器学习模型虽可分析历史太阳辐射模式,却无法支持自然语言查询或提供基于证据的解释。当工程师、科学家或学生进入该领域时,需在不同仪表板和预测网站间切换、向数据公司申请数据、进行分析才能做出决策——这一过程常耗费数月甚至一年。检索增强生成技术的最新进展表明,结合信息检索与大语言模型能实现基于外部数据源的知识密集型推理(Lewis等人,2020)。近期综述指出,RAG框架通过显式检索机制减少幻觉并提升事实一致性,有效弥补了传统模型的缺陷(Gao等人,2023)。 本项目提出“太阳能智能系统”——一个基于混合RAG框架构建的智能系统。该系统整合多年太阳辐照度数据集与精选科学文献,实现结构化与语义化双重检索。系统通过交互式Streamlit仪表板检索相关数据窗口与科学文献段落,将其作为锚定上下文提供给大语言模型,并生成带引用、基于证据的回答。这一系统的重要性在于:现代太阳能运营已从单纯数据获取转向对预测质量的依赖,近期能源预测研究表明,预测质量直接影响太阳能电力系统的电网运行、调度安排与经济价值(Mayer等人,2026;Gandhi等人,2024)。 太阳能智能系统的主要目标是构建一个集太阳能领域查询、分析与预测于一体的软件平台,使用户无需在不同太阳辐射工具间切换即可做出决策。系统设计遵循三大原则:其一,将多年太阳能数据与精选科学文献整合于单一检索系统,使数值证据与出版物证据可通过同一查询获取;其二,支持太阳能主题的自然语言提问,返回基于检索数据和文档的、带引用的答案,既减少无依据回复,也免除了用户对底层数据结构的认知要求;其三,在统一查询界面内提供关键太阳能变量的预测功能。该系统以可运行软件形式交付,通过仪表板和API双渠道访问,采用模块化设计以支持更新与扩展。区别于通用语言模型,本系统的检索层基于太阳辐射领域专用语料库构建而非通用网络知识。 本文结构安排如下:引言之后依次介绍研究数据集、系统构建方法论、系统架构与实现,结果与讨论部分展示查询系统输出和预测功能,随后阐述部署架构、当前版本局限性、结论及未来工作。 ## 2数据来源 太阳能智能系统整合三类互补数据源(表1)。第一类是领域专用语料库,包含149篇研究论文和报告(1994–2026年),涵盖太阳能科学、工程与仪器领域,其中138篇arXiv论文通过18个主题查询获取,另有11篇机构报告来自NREL、IEA‑PVPS、IRENA和Sandia。第二类是NASA POWER数据服务提供的每日气象与太阳辐射数据(2012–2026年,5225条日记录),针对亚利桑那州生物圈2号观测站(北纬32.578°,西经110.848°),包含太阳辐照度、气温、相对湿度、风速及降水数据。其中太阳辐射数据源自CERES SYN1deg卫星产品,气象参数则基于NASA全球建模与同化办公室开发的MERRA‑2再分析数据。第三类是亚利桑那大学生物圈2号设施的地面传感器数据(2012年8月–2013年7月,1040万条分钟级读数),涵盖气温、太阳辐照度和风速。文中B2与b2均指生物圈2号。 表1:太阳能智能系统采用的数据源 ## 3方法论 方法论包含五个组成部分:语料库构建与处理、查询路由检索、生物圈2号地面数据清洗、卫星产品与地面传感器跨源对比以及预测。以下分小节详述。 ### 3.1语构库构建与处理 领域专用(太阳能)语料库由研究论文和报告构成。arXiv子集通过官方API发起跨18个太阳能子领域的主题查询构建,涵盖光伏效率、辐照度预测、污垢效应、基于全天空成像仪的预测、大气衰减及聚光光伏(表2)。机构子集直接从NREL、IEA‑PVPS、IRENA和Sandia下载,包括《系统顾问模型参考手册》和PVWatts第5版手册。 表2:构建arXiv子集的18个主题查询 | 类别 | 主题查询 | 最大结果数 | |------|----------|------------| | 1 | 太阳辐照度预测 机器学习 | 20 | | 1 | 太阳能发电 神经网络 | 15 | | 2 | 全球水平辐照度GHI估算 | 15 | | 2 | 直接法向辐照度DNI 晴空 | 10 | | 2 | 卫星太阳辐射测量验证 | 15 | | 2 | NASA POWER太阳能资源评估 | 10 | | 3 | 光伏效率温度系数 | 15 | | 3 | Shockley‑Queisser太阳能电池效率极限 | 10 | | 3 | 光伏系统性能建模 | 15 | | 4 | 沙漠气候光伏积尘 | 10 | | 4 | 光伏长期衰减 | 10 | | 4 | 逆变器MPPT效率 | 10 | | 6 | 大气气溶胶太阳辐射 | 10 | | 6 | 太阳能气象学云量 | 10 | | 7 | 双面太阳能板反照率 | 10 | | 7 | 聚光太阳能发电CSP热力学 | 10 | | 8 | AM1.5标准太阳光谱 | 8 | | 8 | 日射强度计地面测量验证 | 10 | | 总计 | 213条(去重后138条) | 提取PDF后采用PyMuPDF解析,以约500词块(50词重叠)分割,共生成9496个文本块。构建两个并行索引:1) BM25索引(Robertson与Walker,1994;Robertson等人,1994),采用小写规范化分词,故意省略词干提取以保护领域专用术语(GHI、DNI、MPPT、AM1.5、Shockley‑Queisser、钙钛矿‑硅);2) 稠密嵌入索引,使用BGE(小)384维向量(Xiao等人,2023)。 ### 3.2查询路由检索 每个查询并行发送至两个索引,各返回前20个候选结果。由于BM25分数与余弦相似度范围不同,结果通过互惠排序融合技术融合(Cormack等人,2009)。并非所有查询都适用检索,规则分类器通过检测指标关键词(如“辐照度”“温度”)、聚合词汇(均值/最大/最小/趋势)、日期范围及预测关键词,将查询路由至以下类型: - 结构化查询(纯数值):仅发送至DuckDB SQL - 语义查询(纯概念):仅发送至混合检索 - 混合查询(需数值与概念双重证据):双路径并行执行 分类器还基于词汇线索(如“卫星”“地面传感器”或年份范围)进行数据源检测。该路由层至关重要,因为将数值聚合问题发送至生成式模型或将概念问题交由SQL处理均易出错。自然语言答案由Ollama服务的llama3.2:3b生成,严格遵守提示规则(如不捏造数值、每个主张需标注[N]引用)。系统安全机制进一步要求:当分类器识别出强结构化信号时,流程协调器会直接从SQL输出构建数值答案字符串,避免小模型对精确SQL值的模糊处理,仅让模型承担文本框架生成。这种设计使幻觉预防成为架构特性而非单纯依赖提示。 ### 3.3生物圈2号数据清洗 生物圈2号原始数据中多个气象与物理参数存在不合理数值,可能源于传感器故障、通信误差或单位转换问题。因此对选定的气象变量进行范围过滤以维持物理一致性。 ### 3.4NASA POWER与生物圈2号数据对比 针对312个重叠日(2012年8月–2013年7月)的三种气象变量(辐照度、温度、风速),将NASA POWER卫星值与清洗后的生物圈2号地面传感器值进行对比,计算各源均值、有符号偏差(NASA均值‑B2均值)及平均绝对误差。 ### 3.5预测功能 通过XGBoost(Chen与Guestrin,2016)实现辐照度、温度和风速的每日预测。选择XGBoost而非深度学习方法,因其在中小规模表格型时间序列上表现优异(Grinsztajn等人,2022)。预测模型仅使用NASA POWER数据训练,生物圈2号11个月记录不足以满足需要多年季节周期的日分辨率预测。太阳能智能系统的特征与超参数见表3。 表3:预测模型所用特征 ## 4系统架构与实现 太阳能智能系统采用模块化软件架构,包含四个主要层次:数据层、分析与知识检索层、预测层和交互层。系统配置与技术栈详见表4。 ### 4.1数据层 该层存储结构化太阳能数据(NASA POWER和生物圈2号)及非结构化科学文本。结构化数据存入DuckDB,包含太阳辐照度、温度、湿度、风速和降水。文档层存储科学文本与太阳能领域文献。 ### 4.2分析与知识检索层 该层处理查询理解与执行。用户提问时,系统首先识别问题类型(结构化、语义或混合查询),因不同类型查询需差异化处理:数值问题不应直接发送至语言模型,科学问题也无法仅用SQL解决。结构化查询路由至DuckDB通过SQL应答,语义查询路由至检索系统基于文档应答,混合查询则同时使用SQL与文档检索。检索系统结合BM25与语义嵌入,通过RRF融合结果。这种组合既实现精确关键词匹配又捕获语义信息,提升了检索质量。检索后的锚定生成模块基于结构化输出、检索证据和严格提示规则构建最终答案,而非仅依赖模型记忆。此设计减少了无依据回复,增强了可追溯性,同时抑制了模型幻觉,并为随机提问提供引导。 ### 4.3预测层 预测层采用XGBoost实现太阳能变量预测。预测引擎使用历史太阳能数据与工程特征(包括滞后值、滚动均值、季节性周期和年内日期特征)。选择XGBoost因其在结构化时间序列数据上表现优异,且在有限数据条件下仍具良好性能。这种选择兼顾训练速度、更新便捷性、可解释性与计算效率,适合软件预测系统。 为获取目标太阳能参数(辐照度、温度或风速)的预测值,用户选定目标变量及预测天数后,太阳能智能系统将请求分发至XGBoost预测引擎。
相似文章
SOLAR: 一种自我优化的开放式自主代理,用于终身学习与持续适应
SOLAR提出了一种自我优化的自主代理,利用参数级元学习和多层次强化学习,使LLMs能够对非平稳数据流进行终身适应,在推理任务上超越基线。
SOLAR:AI驱动的光速性能分析
SOLAR是一个框架,它利用LLM前端和确定性分析,从PyTorch和JAX源代码自动推导经过验证的光速性能界限,从而为深度学习工作负载提供余量分析和优化洞察。
面向跨区域太阳能和风能预测的量子启发变分核与可解释人工智能框架
一篇研究论文,提出了一种用于太阳能和风能预测的四阶段混合框架,利用量子启发变分核进行残差修正,并利用生成式人工智能层实现可解释性。
社交智能基准
本文提出了一个新的基准,旨在评估AI系统的社交智能,衡量其理解和响应社交线索与互动的能力。
技术性比较基准研究:用于可再生能源农场优化与预测的先进AI混合方法
这项比较基准研究评估了多种用于可再生能源农场优化与预测的AI方法,表明集成方法和混合方法在不同数据场景下表现出色。