← 返回笔记
多阶段随机规划 2026年9月15日 约 7 分钟读完

预测更准,不等于交易更好:从申报模拟器到三个月真实回测(中)

评价交易模型不能只看预测误差。我们搭建申报模拟器,并用三个月真实数据检验决策质量。

系列文章申报模拟器真实回测
预测更准,不等于交易更好:从申报模拟器到三个月真实回测(中)封面
多阶段随机规划购电决策系统 · 系列 2/3

公开说明:本文记录的是截至 2026 年 8 月的研究性回测。公开版对内部精确成本做了取整或省略;结果尚未构成充分的样本外证明,也不代表收益承诺或交易建议。

上一篇解释了多阶段随机规划为什么适合连续采购。本篇把问题推进到工程验证:模型的价值,必须落到真实结算成本。

五、我们真正优化的不是“预测误差”

这是整个项目里我们后来越来越明确的一点。

传统预测模型最常使用:

MAE、RMSE、MAPE

来评价效果。

这些指标当然重要。

但是对于交易来说:

预测更准,不一定等于决策更好。

假设模型A预测价格为:

500

真实价格:

510

模型B预测:

530

从预测误差来看:

模型A明显更优秀。

但如果交易规则决定:

只要判断未来价格会高于当前报价450元/MWh,就应该提前采购。

那么:

500

和:

530

可能会导向完全相同的交易动作。

此时,预测精度的提升并没有带来任何实际经济价值。

反过来:

如果一个很小的预测误差刚好跨越了决策边界,

那么即使:

MAE

变化不大,

最终成本却可能发生显著变化。

所以我们的核心评价逐渐从:

预测准确率(Prediction Accuracy)

转向:

决策质量(Decision Quality)

最终模型有没有价值,要看真实结算成本。

六、于是我们做了一个申报模拟器

为了避免模型只停留在代码和公式里,我们后来做了一层完整的实验环境。

整个链路变成:

历史数据

↓

情景生成

↓

多阶段优化

↓

采购策略

↓

96个15分钟时段

↓

真实市场结算

↓

成本评价

换句话说:

模型并不是输出一个“未来电价预测图”。

它真正输出的是:

每一个交易阶段应该采取什么采购动作。

然后把这些动作放回历史真实市场中结算。

这样我们最终得到的不再是:

“模型准确率提高了0.5%。”

而是:

少花了多少元/MWh

七、真实数据结果:连续三个月领先市场基准

目前我们首先对2026年6月至8月进行了真实数据实验。

结果如下:

月份模型相对市场基准
2026年6月约 3.7 元/MWh
2026年7月约 2.1 元/MWh
2026年8月约 1.6 元/MWh

三个自然月:

模型成本低于市场基准成本
模型成本低于市场基准成本

简单平均优势约为:

三个月简单平均成本优势
三个月简单平均成本优势

当然,更严格的整体计算应该按照每个月实际结算电量进行加权,而不是简单平均。

但至少当前结果已经说明了一件事:

模型开始在真实业务数据上表现出稳定的正经济价值信号

注意,我们特意用了“信号”这个词。

而没有直接说:

“模型已经证明长期有效。”

原因很简单:

目前只有三个自然月。

三个正样本非常值得关注,但远远没有达到可以宣称稳定超额收益的程度。

八、一个很有意思的问题:模型为什么没有一定战胜交易员?

项目推进以后,我们碰到了一个非常现实的问题。

公司的实际交易成本,有时候比模型还要低。

第一反应似乎是:

那模型不是输了吗?

但进一步分析后我们发现,这个比较并不公平。

因为实际交易员拥有更多的调仓机会。

也就是说:

实际交易动作空间包含模型动作空间
实际交易动作空间包含模型动作空间

其中:

A

代表可执行的动作集合。

实际交易员可能可以在更多窗口、更多品种、更多时间尺度上调整头寸。

而当前模型只允许在明确设定的若干阶段内行动。

如果两边动作空间本身都不一样,就不能简单比较:

模型成本与实际交易成本的待检验比较
模型成本与实际交易成本的待检验比较

并把输赢直接解释成算法优劣。

因此我们后来把评价体系拆成了三个层次:

市场基准→模型策略→公司实际交易

实际业务经验中,公司本身就可能领先市场约:

2~6 元/MWh

从这个角度看,一个调仓能力明显受限的算法策略,目前已经能达到类似的经济量级,本身就是一个非常值得继续研究的现象。

下篇将回答更严格的问题:怎样证明当前优势不是偶然,以及模型如何走向自适应决策。

多阶段随机规划购电决策系统 · 系列文章

本文为个人研究与学习记录。模型、规则与数据仍需在正式业务环境中重新核验。