Как Poker Sense оценивает ваши решения
От GREAT до BLUNDER: как Poker Sense оценивает покерные решения по частоте солвера, а не по потере EV, и что на самом деле означает по-настоящему близкий спот.
Вы только что закончили тренировочную раздачу в Poker Sense. Вы были на большом блайнде – месте, которое ставит бóльшую из двух вынужденных ставок ещё до того, как розданы карты, – и заколлировали префлоп-рейз с Валетом и Десяткой пик. Флоп, первые три общие карты, пришёл Дама пик, Девятка пик, Четвёрка червей. Вы чекнули, оппонент поставил примерно половину банка, и вы прикинули: открытое стрит-дро (любой Король или Восьмёрка завершает стрит) плюс флеш-дро (ещё одна пика делает флеш). Колл ощущался нормальным. Вы заколлировали.
Пришла оценка: GOOD. Под ней одна строка: “Рейз – основной ход (68%)”.
Хорошо? Не отлично? У вас был монстр-дро, вы выбрали осторожную линию, и, судя по всему, компьютер хотел рейз – но только в 68 процентах случаев, что бы это ни значило. А это поднимает настоящий вопрос. Что вообще значит оценка одного покерного решения? Покер – игра удачи, и сама математика часто говорит играть одну и ту же руку двумя разными способами. Можно ли вообще оценить одно решение?
Можно, но не так, как думает большинство. Разбор того, как Poker Sense на самом деле это делает, оказывается неплохой экскурсией в то, как вообще думать о покерных решениях, – начиная с того, почему очевидный способ оценки не работает.
Очевидный способ оценки и почему он не работает
Очевидный способ оценить покерное решение – измерить, во что оно обошлось. Современная покерная стратегия исходит от солверов: программ, которые играют ситуацию сами против себя миллионы раз, пока не сойдутся к стратегии Game Theory Optimal – сокращённо GTO, – то есть стратегии, которую невозможно эксплуатировать, что бы ни пробовал оппонент. Для любого спота солвер может сказать вам математическое ожидание каждого действия: среднюю сумму, которую это действие выигрывает или проигрывает в долгосрочной перспективе, с усреднённой удачей любой отдельной раздачи. Так что просто сравните выбранный вами ход с лучшим доступным ходом. Разница в средней прибыли – ваша оценка. Просто.
Вот проблема, и это математическое сердце всего этого поста. На большинстве флопов солвер не выбирает одно действие. Он играет смешанную стратегию: с одной и той же рукой в одном и том же споте он иногда рейзит, иногда коллирует, с конкретными частотами. И в равновесии – состоянии, где оба игрока играют идеально и никто не может ничего выиграть, что-либо меняя, – каждое действие, которое солвер реально использует в смешанном споте, имеет ровно одинаковое математическое ожидание.
Это не совпадение. Это причина, по которой смешение вообще существует. Если бы рейз приносил хоть немного больше денег, чем колл, солвер не рейзил бы 68 процентов времени – он рейзил бы 100 процентов времени, потому что солверы безжалостны в отношении прибыли. Смесь может выжить, только когда действия в ней точно уравнены. Теоретики игр называют это принципом безразличия: в равновесии вам безразлично между действиями смеси, потому что они зарабатывают одинаково.
Теперь посмотрите, что это делает с очевидной схемой оценки. Ваш колл с Валет-Десяткой? Ноль потерянного математического ожидания. Рейз, который приложение назвало основным ходом? Тоже ноль. Фолд – единственное действие, которое солвер вообще никогда не делает с этой рукой, – единственный выбор, который хоть что-то стоит. Оценивайте только по потере EV, и почти любое постфлоп-решение, хоть сколько-нибудь разумное, возвращается “идеальным”. Табель успеваемости, где почти всё – пятёрка, – не обратная связь. Это обои.
Сигнал, который потеря EV не видит
Так что Poker Sense оценивает по тому, к чему потеря EV слепа: по частотам солвера.
Когда солвер рейзит 68 процентов и коллирует 32, оба действия хороши – но как привычки они не идентичны. Ваши оппоненты никогда не играют против одного решения; они играют против всего вашего диапазона, то есть каждой руки, которую вы могли бы держать, совершая данное действие. Игрок, который коллирует каждым крупным дро в подобных спотах, одним бесплатным решением за раз строит диапазон, отличный от того, что построил солвер. Его рейзы содержат только сильные готовые руки, что делает эти рейзы лёгкими для игры против них. Его коллы набиты дро, что делает его будущие ставки лёгкими для чтения в момент, когда ложится карта стрита или флеша. Каждый отдельный колл ничего не стоил в равновесии. Привычка тихо перевела его на другую стратегию – ту, для которой гарантия “ничего не стоит” никогда не выдавалась.
Вот идея, на которой построена вся система вердиктов. Соответствие частотам – это сигнал, который потеря EV не может увидеть. Когда ваше действие внутри стратегии солвера, полезный вопрос не “во что это обошлось” (ни во что), а “насколько центрально это действие для стратегии”. Когда ваше действие вне стратегии солвера, цена становится ровно правильным вопросом, потому что теперь она действительно есть.
Шесть вердиктов
Poker Sense сортирует каждое решение в один из шести вердиктов. Первые три означают, что вы были внутри стратегии солвера, и различаются они лишь тем, как часто солвер делает то же, что и вы. Последние три означают, что вы были вне её, и различаются они лишь тем, насколько дорогим было отклонение. Цена измеряется в больших блайндах – размере той вынужденной ставки, которую вы поставили, стандартной единице измерения в покере, обычно сокращаемой до bb.
GREAT означает, что вы выбрали главный ход – действие, которое солвер делает чаще всего, – или действие, которое солвер играет в пределах 10 процентных пунктов от главного. Эта вторая оговорка важна. Когда солвер рейзит 52 процента и коллирует 48, колл – не худший выбор; это половина настоящего орла-решки, и оценивается он соответственно.
GOOD означает, что вы выбрали действие, которое солвер делает значительную долю времени: 15 процентов или больше. Ваш колл Валет-Десяткой попадает сюда. Солвер рейзит эту руку большую часть времени и коллирует большую часть оставшегося, так что колл – реальная часть стратегии. Просто не заголовок.
OKAY означает, что ваше действие есть в стратегии солвера, но редкое: меньше 15 процентов. Ничего не потеряно, не за что извиняться. Но если вы продолжаете попадать сюда в одном и том же типе спота, центр тяжести стратегии находится не там, где вы.
IFFY означает, что вы покинули стратегию, но дёшево: потеряно меньше 1,5 больших блайндов математического ожидания. Реальные деньги со временем, но не катастрофа сегодня.
MISTAKE означает, что отклонение стоило от 1,5 до 3 больших блайндов. Это решения, где сфокусированное изучение окупается быстрее всего.
BLUNDER означает потерю 3 или более больших блайндов. В раздаче Валет-Десятка фолд этого монстр-дро с пятнадцатью аутами на ставку в половину банка сжёг бы несколько больших блайндов и попал бы именно сюда. У всех есть свои бландеры; смысл находить свои во время тренировки в том, что тренировочные фишки бесплатны.
Ещё одно число связывает всё это воедино: ваша точность за сессию – это просто процент решений, оценённых как GREAT или GOOD. Это быстрый показатель того, как часто вы оставались вблизи центра стратегии.
Что на самом деле означает “близкий спот”
Некоторые споты вовсе не близкие – солвер почти всегда делает одно действие, и всё остальное – утечка. Но многие споты по-настоящему смешанные, с двумя или более действиями, которые почти равны. Если солвер ставит 45 процентов и чекает 55, эти ходы – почти близнецы. Принцип безразличия говорит, что они зарабатывают одинаково, а частоты говорят, что солвер едва склоняется в ту или иную сторону.
Представьте, что вам сказали “неудача” за ставку в таком споте. Это была бы не учёба, а шум. Хуже того, это научило бы вас искать единственно правильный ответ в ситуациях, где вся математическая суть в том, что его не существует.
Так что когда спот близкий, Poker Sense так и говорит. 10-процентное окно внутри GREAT существует именно для этого, и строка с инсайтом идёт вместе с ним: “Близкий спот – оба хода надёжны”. Эта строка – способ приложения сказать вам, куда не стоит тратить беспокойство. Руки, которые стоит прокручивать по дороге домой, – те, где вы и солвер по-настоящему разошлись, а не те монетки-подбросы.
Почему оценка – это слово, а не число
Некоторые тренировочные инструменты выводят на первый план сырые числа: ставка стоит 2,31 больших блайнда, чек стоит 2,28. Poker Sense тоже всё это вычисляет – именно так проводятся границы IFFY, MISTAKE и BLUNDER, крупные отклонения оцениваются по тому, сколько именно больших блайндов они сжигают, – но сама оценка никогда не приходит в виде десятичной дроби. Две причины.
Во-первых, ложная точность. Солверный вывод – это сошедшиеся приближения: солвер работает, пока его стратегии не перестают сдвигаться больше, чем на допустимую погрешность, а потом останавливается. Разница между разумными линиями часто составляет тысячные доли большого блайнда, глубоко в шуме самого приближения. Третий знак после запятой выглядит информацией. Это не так.
Во-вторых, слова здесь учат лучше, чем числа. “Вы потеряли 0.03bb” заставляет вас щуриться и гадать, много это или нет. Предложение говорит вам, что делать с тем, что только что случилось. Так что каждое решение получает одну строку простым языком вместо десятичной дроби: “Рейз – основной ход (68%)”, когда есть ясный лидер. “Близкий спот – оба хода надёжны”, когда его нет. “Крупный промах – правильным ходом был Чек”, когда вы забрели куда-то дорогое. Одна строка, и вы знаете, двигаться дальше или углубиться.
Ничего из деталей, к слову, не скрыто. После решения вы можете открыть вид диапазона и увидеть полную раскладку солвера – каждую руку, которую вы могли держать, частоту каждого действия и, да, EV. Разница в том, что идёт первым: оценка сначала даёт вам предложение и держит десятичные дроби там, где их найдут любопытные, вместо того чтобы заставлять вас самостоятельно заниматься интерпретацией.
Чего оценка не может вам сказать
Вот честная граница любой системы оценки: оценка может обнаружить расхождение, но не может его объяснить. GOOD с “Рейз – основной ход (68%)” говорит вам, где разошлись ваши инстинкты и стратегия. Она не говорит, почему солвер так любит рейзить это дро.
Именно в этом “почему” живёт обучение, и именно для этого существует коучинг “Спроси почему”. Нажмите его после раздачи с Валет-Десяткой, и AI-тренер объяснит рассуждение за рекомендованным ходом: ваше дро достаточно сильное, чтобы быть близко к орлу-решке даже против рук, которые продолжают, так что рейз даёт вам два способа выиграть – оппонент фолдит сейчас, или приходит одна из ваших пятнадцати карт, – а наращивание банка, пока ваша рука обладает таким потенциалом, означает, что в те разы, когда вы туда доберётесь, вы выиграете больше. Это рассуждение переносится на следующее крупное дро, которое вы держите, на доске, которой вы никогда раньше не видели. Оценка нашла разрыв; беседа его заполняет. На бесплатном уровне у вас 20 тренировочных рук и 3 беседы с тренером в день – достаточно, чтобы сделать привычкой спрашивать “почему” в тех раздачах, которые вас удивляют.
Итог
Оценка – это зеркало, а не приговор вам как игроку. Она сравнивает одно решение со стратегией: внутри стратегии она говорит вам, насколько центральным было ваше действие; вне её она говорит, во что обошлось отклонение в больших блайндах. Это всё, на что она претендует, – и из-за принципа безразличия это всё, на что может претендовать любая честная оценка.
Ваше число точности заслуживает той же честности. Процент решений, оценённых как GREAT или GOOD, – это тренировочная метрика, а не ваш винрейт. Дисперсия всё равно решит исход пятничного вечера; вы можете играть с точностью 85 процентов и всё равно проиграть три бай-ина, пока парень, который коллирует всё подряд, тащит крупнейший банк года.
Так что да – одно решение можно оценить, даже в игре удачи и смешанных стратегий. Не по тому, выиграло ли оно, и не десятичной дробью, притворяющейся более точной, чем позволяет математика, а по тому, где оно находится относительно стратегии, которую невозможно сдвинуть. Оценка показывает вам, где вы и эта стратегия расходитесь, раздача за раздачей. Что вы с этим делаете – вот настоящая тренировка.
Примените эту концепцию в руках, которые вы играете
20 бесплатных рук в день. Мы объясняем логику каждого решения.
- gto training
- poker verdicts
- mixed strategy
- expected value
- poker feedback
- home game