Back to strategies

Стратегия DQN обучения с подкреплением

Обучаться торговым действиям через состояние, вознаграждение и обратную связь портфеля

Стратегия DQN обучения с подкреплением — это шаблон торговли на машинном обучении, который преобразует признаки состояния рынка, состояния позиции, вознаграждения и истории действий в валидированный сигнал политика deep Q-network, а затем применяет явные средства контроля исполнения, выхода и риска модели. - Mnih et al. 2015

Эта стратегия представлена как образовательный пример, вдохновленный общими концепциями технического анализа и справочными материалами. Она предназначена только для исследований и демонстрации продукта и не является инвестиционным советом.

⚠️ Соответствие стратегии
РИСК: EXTREME
Подходит для
  • Рынки, где признаки состояния рынка, состояния позиции, вознаграждения и истории действий доступны point-in-time и могут быть сопоставлены с исполнимыми заявками.
  • Исследовательские процессы, способные валидировать политика deep Q-network с хронологическими разбиениями, а не случайным перемешиванием.
  • Портфели, где действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за риск достаточно силён, чтобы пережить издержки, оборот и затухание модели.
Избегать при
  • Наборы данных с ошибкой выжившего, признаками с заглядыванием вперёд, пересмотренными фундаментальными данными или метками, которые не были торгуемы на момент решения.
  • Рынки, где прогнозируемое преимущество меньше издержек спреда, проскальзывания, займа или задержки.
  • Переобученное исследование, где сложность модели растёт быстрее, чем свидетельства вне выборки.
🕒 Таймфреймы
IntradayDailyResearch dependent
🌍 Рынки
FuturesCryptoStocksSimulated portfolios
📢 Стратегии машинного обучения могут выглядеть точными, скрывая при этом утечку или переобучение под режим; проверку формирования вознаграждения, контроль утечки среды и стопы по просадке политики требует явного мониторинга.
В: В чём основная идея Стратегия DQN обучения с подкреплением?
Стратегия обучает политика deep Q-network на признаки состояния рынка, состояния позиции, вознаграждения и истории действий, прогнозирует оптимальную ценность действия для решений удержания, покупки, продажи или ребалансировки и торгует только когда действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за риск.
В: Каков наибольший риск в Стратегия DQN обучения с подкреплением?
Наибольший риск — обычно утечка данных или переобучение: бэктест может использовать информацию, которой не существовало бы до сделки.
В: Как следует проводить бэктест Стратегия DQN обучения с подкреплением?
Используйте данные point-in-time, хронологическую walk-forward валидацию, реалистичные транзакционные издержки и финальный нетронутый период вне выборки перед развёртыванием.

Как работает эта стратегия

5-этапный поток решений: от анализа рынка до управления сделкой

1
Набор признаков
Построить входы point-in-time
Построить признаки состояния рынка, состояния позиции, вознаграждения и истории действий без утечки будущей информации
Выровнять каждый признак по метке времени, когда он был бы известен
Удалить нестабильные, разреженные или неисполнимые входы до обучения
BBMACD
2
Дизайн цели
Определить торгуемые метки
Обучить модель прогнозировать оптимальную ценность действия для решений удержания, покупки, продажи или ребалансировки
Хронологически разделить периоды обучения, валидации и теста в стиле реальной торговли
Отклонять определения цели, игнорирующие издержки, задержку, заём или допущения об исполнении
КасаниеПриближение пересечения
3
Валидация
Проверить устойчивость модели
Проводить валидацию с помощью офлайн-среды обучения и тестирования с walk-forward рыночными эпизодами
Сравнивать прогнозную способность с простым бенчмарком на основе правил
Проверять важность признаков, калибровку и чувствительность к режиму перед развёртыванием
Сигнал BBПересечение MACD✓ GO
4
Торговое правило
Преобразовать оценку в заявки
Срабатывать только когда действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за риск
Исполнять через заявки, обусловленные действием, с ограничениями по позиции и обороту
Выходить, когда политика выбирает сокращение или флэт, достигается бюджет риска или ухудшается режим вознаграждения
ПОКУПКАЧастичноПРОДАЖАЗона прибыли
5
Риск модели
Контролировать дрейф и переобучение
Применять проверку формирования вознаграждения, контроль утечки среды и стопы по просадке политики перед использованием в реальной торговле
Отслеживать затухание прогноза, изменения схемы данных и дрейф распределения признаков
Выводить модель из эксплуатации, когда реальные решения расходятся с валидированным поведением
ВходSLTPТрейлинг-стоп2%R:R
Справочник компонентов стратегии

Стратегия DQN обучения с подкреплением

Обучаться торговым действиям через состояние, вознаграждение и обратную связь портфеля

DQN
Policy
Трейдер
SC StratCraft
FНабор признаков
признаки состояния рынка, состояния позиции, вознаграждения и истории действийВходы модели
оптимальную ценность действия для решений удержания, покупки, продажи или ребалансировкиЦель обучения
Выравнивание point-in-timeКонтроль утечек
MОбучение модели
политика deep Q-networkПрогнозный движок
офлайн-среды обучения и тестирования с walk-forward рыночными эпизодамиТест вне выборки
Эталонная модельПорог мастерства
EПравила входа
действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за рискТриггер сделки
заявки, обусловленные действием, с ограничениями по позиции и оборотуСпособ заявки
Калибровка оценкиПорог уверенности
XПравила выхода
политика выбирает сокращение или флэт, достигается бюджет риска или ухудшается режим вознагражденияОсновное закрытие
Обновление прогнозаОбновление модели
Тайм-аут сигналаВыход по устаревшему сигналу
RКонтроль риска
проверку формирования вознаграждения, контроль утечки среды и стопы по просадке политикиЖёсткие ограничения
Дрейф признаковЗдоровье данных
Проверка переобученияДисциплина исследования
Стратегия DQN обучения с подкреплением
Стратегия DQN обучения с подкреплением — это шаблон торговли на машинном обучении, который преобразует признаки состояния рынка, состояния позиции, вознаграждения и истории действий в валидированный сигнал политика deep Q-network, а затем применяет явные средства контроля исполнения, выхода и риска модели.
Стратегия DQN обучения с подкреплением Market Suitability
The Стратегия DQN обучения с подкреплением strategy works best in Рынки, где признаки состояния рынка, состояния позиции, вознаграждения и истории действий доступны point-in-time и могут быть сопоставлены с исполнимыми заявками.. Исследовательские процессы, способные валидировать политика deep Q-network с хронологическими разбиениями, а не случайным перемешиванием.. Портфели, где действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за риск достаточно силён, чтобы пережить издержки, оборот и затухание модели.. Traders should avoid using this strategy in Наборы данных с ошибкой выжившего, признаками с заглядыванием вперёд, пересмотренными фундаментальными данными или метками, которые не были торгуемы на момент решения.. Рынки, где прогнозируемое преимущество меньше издержек спреда, проскальзывания, займа или задержки.. Переобученное исследование, где сложность модели растёт быстрее, чем свидетельства вне выборки.. The risk level is categorized as EXTREME. Стратегии машинного обучения могут выглядеть точными, скрывая при этом утечку или переобучение под режим; проверку формирования вознаграждения, контроль утечки среды и стопы по просадке политики требует явного мониторинга.
В чём основная идея Стратегия DQN обучения с подкреплением?
Стратегия обучает политика deep Q-network на признаки состояния рынка, состояния позиции, вознаграждения и истории действий, прогнозирует оптимальную ценность действия для решений удержания, покупки, продажи или ребалансировки и торгует только когда действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за риск.
Каков наибольший риск в Стратегия DQN обучения с подкреплением?
Наибольший риск — обычно утечка данных или переобучение: бэктест может использовать информацию, которой не существовало бы до сделки.
Как следует проводить бэктест Стратегия DQN обучения с подкреплением?
Используйте данные point-in-time, хронологическую walk-forward валидацию, реалистичные транзакционные издержки и финальный нетронутый период вне выборки перед развёртыванием.
признаки состояния рынка, состояния позиции, вознаграждения и истории действий
признаки состояния рынка, состояния позиции, вознаграждения и истории действий формируют наблюдаемые входы модели; каждое значение должно быть доступно до симулированной метки времени принятия решения. Formula: Point-in-time feature matrix
оптимальную ценность действия для решений удержания, покупки, продажи или ребалансировки
оптимальную ценность действия для решений удержания, покупки, продажи или ребалансировки определяет то, что модель пытается спрогнозировать, поэтому должна включать реалистичный горизонт удержания и допущение о торговых издержках. Formula: Future return or action label
Выравнивание point-in-time
Выравнивание point-in-time не позволяет модели обучаться на пересмотренной или будущей информации, которой не существовало бы в реальной торговле. Formula: Feature time <= decision time
политика deep Q-network
политика deep Q-network преобразует сконструированные рыночные признаки в оценку, класс, прогноз или действие, которые можно проверить на невиданных периодах. Formula: Q(s,a) <- r + gamma max_a Q(s_next,a)
офлайн-среды обучения и тестирования с walk-forward рыночными эпизодами
офлайн-среды обучения и тестирования с walk-forward рыночными эпизодами проверяет, остаётся ли обученная модель полезной при оценке на более поздних данных, не использованных для обучения. Formula: Walk-forward split
Эталонная модель
Эталонная модель подтверждает, что сложность машинного обучения добавляет ценность сверх простого правила моментума, возврата к среднему или фактора. Formula: Compare with simple baseline
действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за риск
действие политики имеет положительное ожидаемое вознаграждение после издержек и штрафов за риск превращает вывод модели в строгое правило входа, а не рассматривает каждый прогноз как сделку. Formula: Prediction score clears threshold
заявки, обусловленные действием, с ограничениями по позиции и обороту
заявки, обусловленные действием, с ограничениями по позиции и обороту задаёт тайминг заявки, размер позиции и ограничение оборота, используемые, когда сигнал модели становится исполнимым. Formula: Signal to order conversion
Калибровка оценки
Калибровка оценки сопоставляет сырой вывод модели с сопоставимыми уровнями уверенности, чтобы размер позиции опирался на проверенную надёжность. Formula: Probability or rank bucket
политика выбирает сокращение или флэт, достигается бюджет риска или ухудшается режим вознаграждения
политика выбирает сокращение или флэт, достигается бюджет риска или ухудшается режим вознаграждения не даёт сделке по модели превратиться в неуправляемую дискреционную позицию после затухания прогноза. Formula: Prediction no longer supports exposure
Обновление прогноза
Правила обновления прогноза определяют, как часто стратегия пересчитывает признаки и заменяет устаревшие решения модели. Formula: Re-score on schedule
Тайм-аут сигнала
Тайм-аут сигнала закрывает позиции, когда исходный горизонт прогноза истёк без ожидаемого движения. Formula: Close after forecast horizon
проверку формирования вознаграждения, контроль утечки среды и стопы по просадке политики
проверку формирования вознаграждения, контроль утечки среды и стопы по просадке политики ограничивает экспозицию позиций, дрейф модели и реальное поведение, которое больше не соответствует валидированной исследовательской выборке. Formula: Model and portfolio limits
Дрейф признаков
Мониторинг дрейфа признаков выявляет момент, когда реальные распределения входов достаточно отдалились от обучающих данных, чтобы сделать допущения модели недействительными. Formula: Live distribution versus train
Проверка переобучения
Проверка переобучения сопоставляет сложность модели, оборот и число параметров с объёмом устойчивых свидетельств вне выборки. Formula: Complexity versus evidence