The 强化学习 DQN 策略 strategy works best in 市场状态、持仓状态、奖励与动作历史特征可按时点获取、并能映射为可执行订单的市场。. 能够用按时间顺序的划分(而非随机打乱)来验证deep Q-network 策略的研究流程。. 在计入成本与风险惩罚后,策略动作具有正的预期奖励足够强、能够在成本、换手和模型衰减之后依然成立的组合。. Traders should avoid using this strategy in 存在幸存者偏差、前视特征、经修订的基本面,或在决策时点本不可交易的标签的数据集。. 预测优势小于价差、滑点、融券或延迟成本的市场。. 模型复杂度上升快于样本外证据的过拟合研究。. The risk level is categorized as EXTREME. 机器学习策略可能看起来很精确,却隐藏着数据泄露或状态过拟合;奖励塑形审查、环境泄露控制与策略回撤止损需要明确的监控。