← 返回笔记
研究评测 2026年9月3日 约 17 分钟读完

TimesFM-3 零样本实测:日前价领先最清楚,价差方向与极端价格仍是短板

基于江苏日前价、实时价与价差的离线研究,比较 TimesFM-3 与多种基线的点预测、方向判断、概率校准和极端场景表现,梳理优势与适用边界。

TimesFM-3电价预测零样本学习模型评测研究边界

基于江苏日前价、实时价与日前−实时价差的实证研究
业务数据截止:2026-08-31|评述日期:2026-09-03|用途:非商业、非生产研究

TL;DR(一句话结论): TimesFM-3 在三个目标的整体 MAE 上都优于本轮固定配置的监督与统计基线,日前价的领先证据最硬;但它在价差方向、概率校准、极端价格尾部以及"长历史一定更好"上没有稳定优势,还不能被称作可靠的价差方向模型或极端价格风险系统


文章目录 · 12 节
  1. 一、总体判断
  2. 二、模型定位:官方能力与本次实测不是一回事
  3. 三、我们究竟验证了什么
  4. 四、点预测评价:日前优势最清楚,实时和价差接近 Chronos
  5. 五、价差方向:数值误差较好,不等于方向足够可靠
  6. 六、协变量与多变量:接口齐全,但收益有条件
  7. 七、数据效率与长预测:少本地训练依赖,不等于短历史也足够
  8. 八、概率预测:分位损失较好,不代表区间已校准
  9. 九、极端场景:平均领先不能推导尾部可靠
  10. 十、效率与工程可用性:单卡可运行,精度与速度有取舍
  11. 十一、最终建议:继续研究,不把它升级成已经验证的决策系统
  12. 十二、证据、复核与报告适用范围

一、总体判断

TimesFM-3 是本次实验中很有竞争力的零样本点预测模型,优势在日前价上最清楚;但它还不是一个已经证明可靠的价差方向判断或极端价格风险预测系统。

它最值得肯定的,不是模型新、参数多或接口齐全,而是:在不对本地电价训练的前提下,在三个目标各自的整体 MAE 上均低于本轮固定配置树模型、从零深度模型和统计基线;没有另行构造跨目标"总 MAE"。最需要克制的,是把这种平均误差优势扩大为"多变量必然更好""概率区间可信""能稳定预测交易方向"或"理解市场因果机制"。这些更强的说法没有得到本次数据支持。

本报告给出的是研究用途的能力评价,不输出主观星级或加权总分,也不把模型选择意见作为商业或交易决策建议。

评价维度 本次判断 证据边界
零样本点预测 优势较明确 三目标整体 MAE 优于本轮非基础模型配置;不代表击败充分调参后的全部方法
相对 Chronos-2 日前较好,实时与价差接近 基础单日任务中,只有日前 MAE 差的区间支持 TimesFM 更好
价差方向 有一定信号,可靠性有限 基础命中率 57.58%,正方向召回偏低;不能确认优于 Chronos 或昨日同刻
历史与未来信息利用 有条件的增益 日前"历史协变量→加未来轨迹"有支持;不能泛化为整体加信息必胜
相关序列与抗噪声 尚未证实稳定优势 三目标相关历史 MAE 增益均不确定;噪声也未通过预定等价门槛
上下文与长跨度 能利用较长历史,但非单调改善 30 天不总比 14 天好;四天预测的价格误差仍明显增长
概率预测 分位损失较好,校准不足 日前标称 80% 区间只覆盖约 72%,加入完整协变量后仍有不足
极端价格 共同短板,不能视为强项 尖峰误差显著放大,日前尖峰不如昨日同刻;实时/价差事件较少
本地运行 单卡研究可运行,但不是最快 基础热推理约 114 ms/目标窗口,Chronos 约 16.4 ms

二、模型定位:官方能力与本次实测不是一回事

根据 Google Research 2026-08-31 的官方介绍,TimesFM-3 约有 3.3 亿参数,使用超过 1 万亿个时序点预训练;其模型原生支持多目标、历史协变量、已知未来协变量和九分位预测。官方还介绍了交替的时间/变量注意力和一次生成完整预测跨度的设计,并报告多个公开基准上的领先表现。这些是官方披露,不等于我们已独立复现其全部公开基准。

从使用方式看,它提供的是一种"将允许看到的历史和未来已知信息输入固定模型,再输出预测"的方法。本次没有用它分析政策文本、推断市场因果机制或自动制定交易策略;对这些能力不作评价。模型包含时间因果掩码,也不能代替数据端的可用性审计:喂入事后修订价格或未来实况,仍会产生泄露风险。

官方权重采用 TimesFM Non-Commercial License v1.0,限制于其许可范围内的非商业、非生产用途;商业/生产及相关输出用途不能仅凭"权重可下载"推定已获授权。本轮按用户确认的非商业研究范围执行,不把它称作可无限制商用的开源模型


三、我们究竟验证了什么

研究问题是:TimesFM-3 能否在本地价格标签有限、参数不微调的情况下,做好基础电价预测;扩展上下文、协变量和相关历史是否产生稳定收益;其方向、概率、极端场景和计算表现是否与平均误差优势一致。

项目 实际口径
数据范围 2026 年初至 08-31 的冻结历史数据;三个目标来自同一市场,价差=日前−实时,不是三个独立数据集
训练 任务专用模型使用 1—6 月数据;基础任务有 167 个训练标签日窗口。TimesFM 固定官方预训练权重,不用这些标签更新参数
测试 07-01—08-31 逐日滚动,基础单日任务每目标 62 日、5,952 点
基础输入/输出 过去 14 天 1,344 点,预测紧接着的 96 点;原点为北京时间目标日 00:00
模型使用 零样本、中位数点预测、CUDA 推理;关闭非负裁剪和对称平均,不微调、不拟合残差修正
输入隔离 各原点独立;其他目标历史仅用于相关序列实验,不使用其他目标未来真实价格
对照 Chronos-2、原 XGBoost/LightGBM、特征增强 LightGBM、从零 PatchTST、ETS、朴素基线
本次证据量 扩展研究共 207 个模型任务,其中 TimesFM 39 个;合并前轮四模型 A/B/C48 结果。不把任务数当成独立样本量
统计 配对 7 日移动块自助抽样 2,000 次,seed=42;报告 95% 区间,未做多重比较校正,不额外构造 p 值

它不是随机流量 A/B 试验。对模型的比较是同一日期上的配对误差比较;窗口高度相关,不能把每个 15 分钟点当作独立样本。新矩阵虽在评分前冻结,但测试期已经在前轮被查看,所以仍是探索性扩展,而非全新盲测

还有三项不能省略的限制:

  1. 价格使用统一冻结的历史修订,不是恢复到每个原点当时可见的版本。原 LEGACY_UNKNOWN 和时间字段未改。
  2. 天气使用已批准的 C48 离线口径:Open-Meteo 13 城等权、气温/风速/云量,历史与未来均使用固定提前量 previous_day2;不混用未来实况,但发布时间未逐批认证,不等于严格天气可用性门禁通过。
  3. TimesFM-3 的官方公告日期恰好是 08-31,绝大多数测试期早于公告;这是事后权重离线研究,不是模型在 7—8 月实际运行的记录。预训练资料描述也不能证明我们的序列与其预训练集绝对无重叠。

四、点预测评价:日前优势最清楚,实时和价差接近 Chronos

4.1 仅使用本目标价格历史

下表为相同 62 日测试、14 天历史→1 天预测,MAE 单位为元/MWh,越低越好。原版与特征增强版 LightGBM 分行显示,不混为一项。

模型 日前 MAE 实时 MAE 价差 MAE
TimesFM-3 22.34 24.43 22.37
Chronos-2 23.97 24.52 22.42
XGBoost 原版 31.19 34.14 26.38
LightGBM 原版 30.66 31.64 27.54
LightGBM 特征增强 31.08 30.04 25.83
PatchTST 从零 31.64 36.02 28.39
ETS 33.28 32.14 33.52
昨日同刻 25.01 30.14 30.47

TimesFM 三目标的 MAE 点估计均最低,但相对另一个基础模型,证据强弱不同:

目标 Chronos MAE − TimesFM MAE,95% 区间 判断
日前价 1.63 [0.24, 2.64] 本轮区间支持 TimesFM 更低
实时价 0.09 [−1.58, 1.00] 差异很小,不能区分
价差 0.04 [−0.42, 0.70] 差异很小,不能区分

日前价的优势并非只来自击败弱基线。 昨日同刻 MAE 为 25.01,是本轮点估计最好的非基础模型日前对照;TimesFM 改善 2.67 [1.39, 4.85],约 10.67%。实时与价差相对特征增强 LightGBM 分别改善约 18.67% 和 13.39%。这些"最佳对照"是本次测试上的描述性选择,不是另一次确认性验证。

基础任务三目标的 96 步误差曲线总览——TimesFM 在三目标的整体水平居前,日前价领先证据最硬。
基础任务三目标的 96 步误差曲线总览——TimesFM 在三目标的整体水平居前,日前价领先证据最硬。

4.2 不能只看 MAE

TimesFM 目标 RMSE 平均偏差:预测−真实 MASE
日前价 32.64 −0.51 0.708
实时价 46.23 −2.61 0.580
价差 43.97 +1.10 0.632

实时与价差的 RMSE 约为 MAE 的两倍,说明较大误差仍有明显影响。Chronos 在这两个目标的 RMSE 还略低于 TimesFM,因此不能将极小的 MAE 优势包装成全面领先。MASE 的分母固定为各目标 1—6 月"昨日同刻"平均绝对差,仅用于评分,不代表实盘收益。

月度结果也支持这种谨慎:实时价 7 月 Chronos 更低(28.25 对 29.10),8 月 TimesFM 更低(19.77 对 20.80);价差两个月都很接近。不能根据这两个事后月度点去设计自动切换模型策略。

评价:可以把 TimesFM 视为有价值的研究基准;日前的领先证据较强,实时和价差应与 Chronos 并列研究,而不是强行排出唯一赢家。


五、价差方向:数值误差较好,不等于方向足够可靠

方向命中率定义为:预测价差与真实价差的 sign 相同的点数/总点数。正、零、负分别计分,零不剔除,不设置事后中性阈值;这里不是价差相对上一时刻的涨跌方向。

5.1 TimesFM 在不同信息条件下的表现

输入条件 价差 MAE 方向命中率
仅历史价格(原 A / 新基础组) 22.37 57.58%
价格+完整日历(原 B) 22.22 55.24%
价格+日历+C48 天气(原 C48 / 新 C2) 22.22 55.63%
仅增加历史日历/天气(新 C1) 22.14 58.01%
增加其他两条价格历史 22.26 59.21%

表中原 B 提供完整日历轨迹,新 C1 只提供历史日历/天气,两者不是同一信息集。不能因为一列 MAE 更低,就推断方向也更好。 从 A 到 C48,MAE 略降,方向却由 57.58% 降至 55.63%。

基础组 TimesFM 为 3,427/5,952 点命中,95% 区间为 [52.96%, 63.37%];Chronos 为 57.85%。Chronos−TimesFM 的配对方向率差为 0.27 个百分点,区间 [−2.60, 1.88],不能确认谁更强。TimesFM 比昨日同刻高约 1.31 个百分点,这个配对差的区间也跨过 0,不能确认稳定胜出。

相关价格历史组虽达到 59.21%,相对基础组的配对增益为 1.63 [−1.28, 4.02] 个百分点,仍不足以确认稳定改善。这项补充计算沿用同一 62 日与相同块抽样方法,没有修改预测,也没有据此选参。

5.2 总命中率掩盖了方向不均衡

真实类别 点数 TimesFM 基础组召回率
负价差 3,319 72.10%
零价差 20 0.00%
正价差 2,613 39.57%

测试标签中负价差占 55.76%,类别并非均衡,不能简单把 50% 当作唯一参照。这个比例只是测试标签分布,不是新增预注册模型成绩。TimesFM 对正价差的召回不足四成,精确零也未命中;仅看总命中率容易高估其双向判断能力。

评价:它捕捉到了一定方向信息,但本轮证据不支持将其称作可靠的价差方向模型,更不能从约 58% 的命中率推导交易盈利。


六、协变量与多变量:接口齐全,但收益有条件

为区分历史信息和未来信息,定义 C0=仅价格,C1=加历史日历/天气,C2=再加完整未来日历/天气轨迹。三组使用相同样本口径与测试日期;涉及监督模型时训练样本一致,TimesFM 始终不做本地训练。

目标 C0 MAE C1 MAE C2 MAE C1→C2 的改善,95% 区间
日前价 22.34 22.58 21.54 1.05 [0.17, 2.40]
实时价 24.43 24.72 23.94 0.78 [−0.07, 2.28]
价差 22.37 22.14 22.22 −0.08 [−0.28, 0.13]

这里最清楚的发现是:已有历史协变量时,日前价可以从未来轨迹中获得增益,改善约 4.63%。实时和价差没有同样明确的证据。

但另一种比较得到的证据更弱:C2 相对纯价格 C0 的日前改善为 0.80 [−0.77, 2.29],实时为 0.50 [−0.86, 1.97],价差为 0.15 [−0.35, 0.52],均跨过 0。条件不同、逐日变化不同,区间也不同;不能把 C1→C2 的结果挪用成"所有协变量整体显著有效"。

前轮单独拆分日历/天气时,日前"日历组→C48 天气组"改善 0.83 [0.07, 1.40],约 3.72%;其余目标没有可靠天气增益证据。我们检验的是这个固定三变量、13 城等权、固定提前量的数据组合,不代表其他天气配置或实盘最新预报无价值。

协变量消融:同一训练/测试样本上的 C0/C1/C2 比较。
协变量消融:同一训练/测试样本上的 C0/C1/C2 比较。

增加其他价格历史,TimesFM 三目标 MAE 改善分别为 −0.31、−0.18、+0.12,全部区间跨 0。价差与两种价格又存在恒等式关系,因此这本来就是有限的冗余关系测试,不能推出跨行业多变量泛化能力。

相关序列 vs 噪声历史:相关历史 MAE 增益不确定,噪声也未通过等价门槛。
相关序列 vs 噪声历史:相关历史 MAE 增益不确定,噪声也未通过等价门槛。

加入两条独立噪声历史后,TimesFM 没有明确退化证据,但也没有一个目标满足预先规定的"整个差值区间落在基准 MAE ±1% 内"的等价门槛。未检出退化,不等于证明它自动忽略噪声。 单一噪声种子也不足以评价全面抗干扰能力。

评价:原生协变量接口降低了研究接入的复杂度;实际精度收益则必须逐目标、逐信息来源验证,不能把接口能力当作效果保证。


七、数据效率与长预测:少本地训练依赖,不等于短历史也足够

7.1 历史窗口不是越长越好

历史长度 日前 MAE 实时 MAE 价差 MAE
1 天 29.46 28.80 24.96
7 天 23.58 25.45 22.73
14 天 22.34 24.43 22.37
30 天 23.14 25.05 24.10

TimesFM 从 1 天到 30 天的日前和实时改善区间支持正增益,价差则不确定。30 天在三个目标的点估计都不如 14 天,说明"更多历史总能提高效果"并不成立。14 天本来就是冻结的基础配置,这里不根据测试曲线重新挑选生产参数。

仅 1 天历史时,日前 MAE 为 29.46,反而不如昨日同刻 25.01。零样本不等于零上下文,也不等于极短上下文一定超过周期规律。

三个目标的上下文扩展结果:TimesFM 从短历史获益,但 30 天并非总优于 14 天;监督基线统一 151 个训练窗口。
三个目标的上下文扩展结果:TimesFM 从短历史获益,但 30 天并非总优于 14 天;监督基线统一 151 个训练窗口。

7.2 "少样本优势"应当怎样表述

监督训练样本预算消融:基础模型固定参照,监督模型重训。
监督训练样本预算消融:基础模型固定参照,监督模型重训。

在保留末 14/30/90/167 个本地训练标签窗口的研究中,两个基础模型保持原零样本预测;它们在各预算点的 MAE 点估计都低于这两个固定配置的监督基线。这支持"对本地标签训练的依赖较小",但不支持"总训练数据或总训练成本更少":基础模型的大规模预训练成本没有消失,只是没有发生在本地。

这也不是纯粹的样本量因果实验。监督基线窗口预算改变了覆盖时期和最近性;PatchTST 固定 50 个 epoch,而非固定优化步数,数据少时实际步数也少。长上下文还增加其位置嵌入参数量。因此不能据此宣称所有从零模型都缺乏数据效率。

7.3 从一天扩展到四天

跨度扩展:59 个公共原点上的 MAE 随跨度变化。
跨度扩展:59 个公共原点上的 MAE 随跨度变化。
同一四天预测的逐日误差:不同天没有真实值更新,误差逐日累积。
同一四天预测的逐日误差:不同天没有真实值更新,误差逐日累积。

跨度实验使用同一 59 个原点,最晚原点为 08-28,所有真实标签仍止于 08-31。不同跨度统一监督训练原点;长预测过程中不插入未来真实价格。

目标 6 小时 MAE 1 天 MAE 4 天 MAE 同次四天预测,第4天/第1天误差比
日前价 15.49 22.42 27.74 1.37
实时价 15.97 24.70 29.17 1.30
价差 17.49 22.16 22.88 1.07

这里的一天分数不能直接替代基础组 62 日分数,因为本表只有 59 个公共原点。6 小时又只覆盖每天凌晨,不能单靠"4 天/6 小时误差比"判断长期能力。

四天任务中,TimesFM 仍优于本轮固定配置非基础模型;相对 Chronos,实时有一定改善证据(1.11 [0.05, 2.17]),日前差异区间略跨 0,价差基本相同。实时的下界也接近 0,且未做多重比较校正,不应过度强调。

评价:具备实用的较长跨度研究能力,但我们只验证到四天,没有验证跨月、跨季节或制度变化后的长期预测能力。


八、概率预测:分位损失较好,不代表区间已校准

本轮使用 10%—90% 共九个分位数,按预定规则逐点排序,未使用测试数据拟合校准;同时保留原始分位头交叉情况。以下均为仅历史价格的基础组。

目标 平均 Pinball 损失 标称 80% 预测区间的实际覆盖率 覆盖率的 95% 区间 平均预测区间宽度
日前价 8.88 72.03% [68.14%, 76.45%] 64.02
实时价 9.95 77.13% [72.82%, 81.43%] 71.12
价差 9.58 77.17% [75.34%, 80.02%] 69.17

Pinball 越低越好,区间宽度单位为元/MWh。这里必须区分:80% 是预测区间的标称覆盖目标,95% 是实际覆盖率统计估计的置信区间,不是同一个东西。

日前的覆盖率区间完全低于 80%,是明确的覆盖不足证据。加入完整日历/天气后覆盖提高至 75.55%,但置信区间 [71.91%, 79.45%] 仍略低于标称值。因此不能直接把原生输出当作可靠风险边界。实时和价差的区间包含或接近 80%,也不是校准已经通过认证。

另一方面,TimesFM 在基础三目标的分位损失都优于季节残差分布参照,配对区间支持;与 Chronos 的基础概率表现,则主要是日前更好,实时与价差难以区分。C2 完整协变量下,TimesFM 三目标 Pinball 都低于 Chronos,配对区间支持,但这仍不消除绝对校准不足。

所报告的基础/C2 概率组中,原始分位交叉率较低,最高约 0.185%;排序防止了输出交叉,但不保证概率含义准确。WIS 也已计算,不过在本轮九分位定义下 WIS=2×平均 Pinball,不把它当第二条独立胜出证据。

基础价格组与完整协变量组的分位覆盖曲线。虚线是理想覆盖;偏离虚线意味着概率校准仍有误差。
基础价格组与完整协变量组的分位覆盖曲线。虚线是理想覆盖;偏离虚线意味着概率校准仍有误差。

评价:适合研究概率输出,但概率校准是下一阶段的重点,而不是可以省略的步骤。本轮没有用测试集修正区间。


九、极端场景:平均领先不能推导尾部可靠

压力阈值只由训练期生成,测试标签仅用于预测之后分层评分。尖峰按偏离训练中位数的绝对幅度定义,不只表示高价;场景可重叠。

目标 正常区间 MAE 尖峰 MAE 尖峰/正常误差比 尖峰点数/事件日
日前价 21.51 61.64 2.87 倍 112 点 / 11 日
实时价 22.52 416.31 18.48 倍 26 点 / 6 日
价差 20.61 435.48 21.13 倍 23 点 / 4 日

日前尖峰上,昨日同刻 MAE 为 52.18,比 TimesFM 的 61.64 更低;两者差异区间支持 TimesFM 在这个子集更差。这说明模型的整体优势主要来自较普通的区间,而不是稳稳预判尖峰。

实时、价差尖峰的事件日又很少。数百元的误差是实际观察到的风险信号,但不能据 4—6 个事件日估计跨时期的稳定尾部胜率。模型在均值换挡代理中的成绩,也不能证明它学会了适应真正的市场制度断点。

尖峰、波动与其他压力场景:星号表示少于 7 个事件日,完整区间在明细 CSV。
尖峰、波动与其他压力场景:星号表示少于 7 个事件日,完整区间在明细 CSV。

评价:本轮不应给 TimesFM"极端风险鲁棒"这一标签。它与其他模型都存在尾部短板,需要额外验证,而不是用整体 MAE 掩盖。


十、效率与工程可用性:单卡可运行,精度与速度有取舍

本机 RTX 5060 Ti 16GB,基础条件为单目标 14 天→1 天,逐原点调用;下表时延取三个目标平均,不含热身、文件读写和原始数据构造。

模型 热推理毫秒/窗口 秒/千窗口 本地拟合要求
TimesFM-3 113.95 113.95 无本地拟合;固定权重 CUDA
Chronos-2 16.41 16.41 无本地拟合;固定权重 CUDA
LightGBM 特征增强 0.66 0.66 先 GPU 训练,CPU 推理
PatchTST 从零 1.80 1.80 先 CUDA 训练,再 CUDA 推理

两基础模型都同时返回九分位,TimesFM 本轮基础热推理约慢 6.9 倍。官方的一次完整跨度生成设计不能直接推导"它在所有调用条件下比其他模型更快"。

TimesFM 单次进程加载约 1.76 秒,供 39 个任务共享,不能重复计费到每一项;基础推理 Torch 分配峰值约 1,273 MiB,整卡采样峰值约 3,696 MiB,进程 RSS 峰值约 2,495 MiB。整卡值包括桌面等占用,且为 0.5 秒间隔采样,不是模型精确显存需求。预训练成本、持续运行能耗和大规模服务吞吐没有计入。

精度与推理时延:黑边为本次 MAE/热时延非支配点;不代表商业部署或概率能力总分。
精度与推理时延:黑边为本次 MAE/热时延非支配点;不代表商业部署或概率能力总分。

在本轮少量日级预测研究中,已有显卡足以完成全部工作。但当实时价、价差基础精度难以区分时,Chronos 的更低时延是一个清楚的研究取舍;不能仅凭 TimesFM 更小一点的 MAE 忽略成本。未提供硬件计费单价,不捏造"每千次多少钱"。

评价:研究工程接入可行,但不是无成本替代方案,也没有完成生产服务、并发吞吐或长期稳定性验证。


十一、最终建议:继续研究,不把它升级成已经验证的决策系统

按照实验结果总结的决策口径,本轮建议为 继续迭代研究(Iterate),而不是直接生产使用(Ship)。这既基于实测边界,也受当前许可和非商业研究范围约束。

对三个目标分别下结论

  • 日前价:TimesFM 最有说服力的任务。可作为后续研究的主要零样本精度参照;重点补查概率覆盖与尖峰失效。
  • 实时价:与 Chronos 的基础精度接近,四天跨度有一定优势;必须同时比较效率和尾部误差,不能认定唯一最优。
  • 价差:数值预测具备竞争力,方向率和正向召回仍有限;没有稳定的多变量增益证据,不应提升为交易方向或收益结论。

后续研究的优先级

优先级 待验证问题 约束
1 新的未看过时间段是否复现当前优势 先冻结设计和模型;不回头优化本轮测试成绩
1 区间能否在保持合理宽度时达到覆盖目标 校准只使用另设训练/校准期,不能用最终测试标签拟合
1 严格历史可用性是否能够恢复 补价格版本与天气发布/可用性证据,不用当前修订或天气实况顶替
2 极端事件与方向表现是否跨时期稳定 增加独立事件期,联合 MAE、方向、分类召回与概率指标;若设中性区间需事先定义
2 多变量与噪声效果是否可复现 增加独立序列、多种固定噪声种子和样本;避免只研究恒等式冗余
3 固定计算预算下是否仍优于任务专用模型 控制训练步数、配置预算和历史覆盖;不能把当前低预算基线当作性能上限

这是下一轮设计建议,不代表已经授权启动新实验、购买数据或安排自动运行。

综合起来,TimesFM-3 的实际价值是:在较少本地训练工作的条件下,提供较强的基础时序点预测和原生概率/协变量研究接口;其弱项是方向可靠性、概率校准、极端价格以及尚未确认的多变量增益。 这些优缺点应同时进入评价,而不是压缩为一个"最强时序大模型"的标签。


十二、证据、复核与报告适用范围

本次专项评述没有重训或修改预测。原扩展研究已完成 207 个任务复载与独立指标复算;方向补充对 83 个保存条件重新核算。现有代码回归记录为 110 项测试、23 子测试通过。这里的测试通过意味着计算与数据合同检查通过,不等于预训练 OOD、严格历史可用性或实际收益已获认证

新增的唯一数值补充是第五节"相关历史相对基础组的方向增益"配对区间:使用既有逐日命中率计算,未更新模型、预测、旧指标表或原报告。

数据与明细索引

内容 文件
全部预测指标(207 个任务的 MAE/RMSE/偏差/MASE/方向) 数据表/能力研究/metrics.csv
MAE 配对差异(同条件、同原点的模型差异区间) 数据表/能力研究/paired_model_differences.csv
信息增益(历史/未来协变量、上下文、相关/噪声比较) 数据表/能力研究/information_gains.csv
概率指标(分位损失、覆盖、宽度与交叉率) 数据表/能力研究/probabilistic.csv
压力指标(事件数、分层误差和压力比) 数据表/能力研究/stress_metrics.csv
效率明细(耗时、内存、显存与设备) 数据表/能力研究/efficiency.csv
逐日方向明细(方向跨条件配对分析的输入) 数据表/方向/daily.csv
原综合实验报告(E1—E8、多模型指标、图表与结论) 报告/综合分析报告.md
方向专题报告(方向定义、分类召回、原四模型与扩展输入结果) 报告/价差方向命中率.md
冻结协议(假设、矩阵、输入范围和证据规则) 协议与配置/冻结实验协议.md
模型版本清单(官方权重 revision 与文件哈希) 协议与配置/官方权重版本清单.json

适用范围到此为止:江苏三条关联价格序列、2026 年 7—8 月测试期、当前冻结配置与离线数据口径。 不外推为所有时序任务的统一排名,也不声称已经证明 TimesFM 理解电力市场机制。