Poker Sense

Як Poker Sense оцінює ваші рішення

Від GREAT до BLUNDER: як Poker Sense оцінює покерні рішення за частотою солвера замість втрати EV, і що насправді означає по-справжньому близький спот.

The Poker Sense TeamЧас читання: 8 хв

Ви щойно завершили тренувальну роздачу в Poker Sense. Ви були в big blind – місці, що ставить більшу з двох примусових ставок ще до роздачі карт, – і заколили префлоп-рейз, тримаючи валета й десятку пік. Флоп, перші три спільні карти, ліг дама пік, дев’ятка пік, четвірка черв. Ви чекнули, опонент поставив приблизно половину банку, і ви оцінили ситуацію: стріт-дро з двох боків (будь-який король або вісімка завершує стріт) плюс флеш-дро (ще одна піка робить флеш). Кол відчувався нормально. Ви заколили.

Оцінка повернулась: GOOD. Під нею – один рядок: “Raise is the main play (68%)” (рейз – головна гра, 68%).

Good? Не great? У вас був монстр-дро, ви обрали обережну лінію, і, вочевидь, комп’ютер хотів, щоб ви рейзили – але лише 68 відсотків часу, що б це не значило. А це піднімає справжнє питання. Що взагалі означає оцінка одного покерного рішення? Покер – гра удачі, і сама математика часто каже грати ту саму руку двома різними способами. Чи можна взагалі оцінити одне окреме рішення?

Можна, але не так, як більшість людей уявляє. Розбір того, як це насправді робить Poker Sense, виявляється непоганою екскурсією в те, як загалом думати про покерні рішення – починаючи з того, чому очевидний спосіб їх оцінювати не працює.

Очевидний спосіб оцінювання – і чому він не працює

Очевидний спосіб оцінити покерне рішення – виміряти, у скільки воно обійшлось. Сучасна покерна стратегія походить від солверів: програм, що мільйони разів програють ситуацію самі проти себе, поки не збіжаться до Game Theory Optimal стратегії – скорочено GTO, – тобто стратегії, яку неможливо експлуатувати, хай що б спробував опонент. Для будь-якого спота солвер може сказати вам Expected Value (EV) кожної дії: середню суму, яку ця дія виграє чи програє в довгостроковій перспективі, з усередненою удачею окремих роздач. Тож просто порівняйте гру, яку ви обрали, з найкращою доступною грою. Розрив у середньому прибутку – ваша оцінка. Просто.

Ось проблема, і це математичне серце всього цього посту. На більшості флопів солвер не обирає одну дію. Він грає змішану стратегію: з тією самою рукою в тому самому споті він іноді рейзить, іноді колує, з конкретними частотами. І в рівновазі – стані, де обидва гравці грають ідеально і жоден не може нічого виграти, щось змінивши, – кожна дія, яку солвер справді використовує в змішаному споті, має рівно однакову Expected Value.

Це не збіг. Це причина, чому мікшування взагалі існує. Якби рейз приносив хоч трохи більше грошей, ніж кол, солвер рейзив би не 68 відсотків часу, а 100 відсотків, бо солвери безжальні щодо прибутку. Мікс може вижити, лише коли дії в ньому точно зрівняні. Теоретики ігор називають це принципом байдужості: у рівновазі ви байдужі між діями в міксі, бо вони заробляють ідентично.

А тепер погляньте, що це робить з очевидною схемою оцінювання. Ваш кол із рукою валет-десятка? Нуль втраченого EV. Рейз, який застосунок назвав головною грою? Теж нуль. Фолд – єдина дія, яку солвер із цією рукою ніколи не робить, – єдиний вибір, що щось коштує. Оцінюйте лише за втратою EV, і майже кожне постфлоп-рішення, яке хоч приблизно розумне, повертається “ідеальним”. Табель, де майже все – відмінно, це не фідбек. Це шпалери.

Сигнал, якого втрата EV не бачить

Тож Poker Sense оцінює за тим, до чого втрата EV сліпа: за частотами солвера.

Коли солвер рейзить 68 відсотків і колує 32 відсотки, обидві дії хороші – але вони не однакові як звички. Ваші опоненти ніколи не грають проти одного рішення; вони грають проти всього вашого діапазону, тобто кожної руки, яку ви могли б тримати, роблячи певну дію. Гравець, що колує кожним великим дро в подібних спотах, одне безкоштовне рішення за раз будує інший діапазон, ніж побудував солвер. Його рейзи містять лише сильні готові руки, що робить ці рейзи легкими для гри проти. Його коли напхані дро, що робить його подальші ставки легкими для читання в момент, коли лягає стріт-карта чи флеш-карта. Кожен окремий кол нічого не коштував у рівновазі. Але звичка тихо перемістила гравця на іншу стратегію – ту, для якої гарантія “нічого не коштує” ніколи не видавалась.

Це і є прозріння, на якому побудована вся система вердиктів. Відповідність частотам – сигнал, якого втрата EV не бачить. Коли ваша дія всередині стратегії солвера, корисне питання не “у скільки це обійшлось” (нуль), а “наскільки центральна ця дія для стратегії”. Коли ваша дія поза стратегією солвера, вартість стає рівно правильним питанням, бо тепер вона справді є.

Шість вердиктів

Poker Sense сортує кожне рішення в один із шести вердиктів. Перші три означають, що ви були всередині стратегії солвера, і вони різняться лише тим, як часто солвер робить те, що зробили ви. Останні три означають, що ви були поза нею, і різняться лише тим, наскільки дорогим був цей відхід. Вартість вимірюється в big blind – розмірі тієї примусової ставки, яку ви поставили, стандартній одиниці вимірювання в покері, зазвичай скороченій до bb.

GREAT означає, що ви обрали основну гру – дію, яку солвер робить найчастіше, – або дію, яку солвер грає з частотою в межах 10 відсоткових пунктів від основної. Це друге застереження важливе. Коли солвер рейзить 52 відсотки й колує 48, кол – не гірший вибір; це половина справжнього кидка монети, і оцінюється він саме так.

GOOD означає, що ви обрали дію, яку солвер робить значну частку часу: 15 відсотків або більше. Ваш кол із валет-десяткою потрапляє сюди. Солвер рейзить цю руку більшість часу і колує більшість решти, тож кол – справжня частина стратегії. Просто не заголовна.

OKAY означає, що ваша дія в стратегії солвера, але рідкісна: менш ніж 15 відсотків. Нічого не втрачено, нема за що вибачатись. Але якщо ви постійно потрапляєте сюди в подібних спотах, центр ваги стратегії – десь не там, де ви.

IFFY означає, що ви вийшли за межі стратегії, але дешево: менш ніж 1,5 big blind втраченого EV. Реальні гроші з часом, але не надзвичайна ситуація сьогодні.

MISTAKE означає, що відхід коштував від 1,5 до 3 big blind. Це рішення, де сфокусоване вивчення окупається найшвидше.

BLUNDER означає втрату 3 і більше big blind. У руці валет-десятка скидання цього монстр-дро з п’ятнадцятьма аутами на ставку в половину банку спалило б кілька big blind і потрапило б сюди. У кожного всередині є блендери; сенс знаходити свої на тренуванні в тому, що тренувальні фішки безкоштовні.

Ще одне число зв’язує все це докупи: точність вашої сесії – це просто відсоток ваших рішень, оцінених GREAT або GOOD. Це швидкий показник того, як часто ви лишались біля центру стратегії.

Що насправді означає “близький спот”

Деякі споти зовсім не близькі – солвер робить одну дію майже завжди, а все інше – вада. Але чимало спотів справді змішані, з двома чи більше діями, майже рівними між собою. Якщо солвер ставить 45 відсотків і чекає 55, ці гри практично близнюки. Принцип байдужості каже, що вони заробляють однаково, а частоти кажуть, що солвер ледь схиляється в той чи інший бік.

Уявіть, що вам сказали, ніби ви “провалились”, поставивши в такому споті. Це було б не навчанням, а шумом. Гірше того, це привчило б вас полювати на єдину правильну відповідь у ситуаціях, де вся математична суть у тому, що її не існує.

Тож коли спот близький, Poker Sense так і каже. Вікно в 10 пунктів усередині GREAT існує саме для цього, і рядок-підказка виходить прямо разом з ним: “Close spot – both plays are solid” (близький спот – обидві гри хороші). Цей рядок – це застосунок, що каже вам, куди не варто витрачати хвилювання. Роздачі, варті прокручування в голові дорогою додому, – це ті, де ви й солвер справді розійшлись, а не кидки монети.

Чому оцінка – це слово, а не число

Деякі тренувальні інструменти починають із сирого виводу: ставка варта 2,31 big blind, чек вартий 2,28. Poker Sense теж усе це обчислює – саме так проводяться межі IFFY, MISTAKE і BLUNDER, великі відхилення оцінюються точно за тим, скільки big blind вони спалюють, – але сама оцінка ніколи не приходить у вигляді десяткового числа. Дві причини.

Перша – хибна точність. Вивід солвера – це збіжні наближення: солвер працює, поки його стратегії не перестануть рухатись більше ніж на допустиму похибку, а тоді зупиняється. Різниця між розумними лініями часто становить тисячні частки big blind, у самому шумі наближення. Третій знак після коми виглядає як інформація. Це не так.

Друга – слова тут навчають краще за числа. “Ви втратили 0.03bb” змушує вас мружитись і гадати, багато це чи ні. Речення каже вам, що робити з тим, що щойно сталось. Тож кожне рішення натомість отримує однорядкову підказку простою мовою: “Raise is the main play (68%)”, коли є чіткий основний варіант. “Close spot – both plays are solid”, коли його немає. “Big miss – Check was the play here” (велика помилка – правильною грою був чек), коли ви забрели кудись дорого. Один рядок – і ви знаєте, чи йти далі, чи заглибитись.

Жодна деталь не прихована, щоб було зрозуміло. Після рішення ви можете відкрити перегляд діапазону й побачити повний розклад солвера – кожну руку, яку ви могли б тримати, частоту кожної дії, і так, EV. Різниця в тому, що йде першим: оцінка спершу дає вам речення й тримає десяткові числа там, де їх знайдуть допитливі, замість того, щоб змушувати вас самостійно все інтерпретувати.

Що оцінка не може вам сказати

Ось чесна межа будь-якої системи оцінювання: оцінка може локалізувати розбіжність, але не може її пояснити. GOOD з підказкою “Raise is the main play (68%)” каже вам, де розійшлись ваші інстинкти й стратегія. Вона не каже вам, чому солвер так любить рейзити цим дро.

Оце “чому” – там, де живе навчання, і саме для цього існує коучинг “Запитати чому”. Натисніть його після роздачі з валет-десяткою, і AI-коуч пояснить логіку за рекомендованою грою: ваше дро достатньо сильне, щоб ви були близькі до кидка монети навіть проти рук, що продовжують, тож рейз дає вам два шляхи до перемоги – опонент скидає зараз, або приходить одна з ваших п’ятнадцяти карт, – а будувати банк, поки ваша рука має такий потенціал, означає, що коли ви дістаєтесь мети, ви виграєте більше. Ця логіка переноситься на наступне велике дро, яке ви триматимете, на борді, якого ви ще ніколи не бачили. Оцінка знайшла розрив; розмова його заповнює. На безкоштовному тарифі ви отримуєте 20 тренувальних роздач і 3 розмови з коучем на день – достатньо, щоб запитувати “чому” на руках, що вас дивують, стало звичкою.

Підсумок

Оцінка – це дзеркало, а не вирок вам як гравцю. Вона порівнює одне рішення зі стратегією: всередині стратегії вона каже вам, наскільки центральною була ваша дія; поза нею – каже, у скільки big blind обійшовся відхід. Це все, на що вона претендує, – і через принцип байдужості це все, на що може претендувати будь-яка чесна оцінка.

Ваше число точності заслуговує на ту саму чесність. Відсоток рішень, оцінених GREAT або GOOD, – це метрика тренування, а не ваш вінрейт. Варіанс усе одно вирішить вашу п’ятницю: ви можете грати з точністю 85 відсотків і все одно програти три бай-іни, поки хлопець, що колує все, забирає найбільший банк року.

Тож так – одне рішення можна оцінити, навіть у грі удачі й змішаних стратегій. Не за тим, чи воно виграло, і не десятковим числом, що вдає більшу точність, ніж насправді дає математика, а за тим, де воно стоїть відносно стратегії, яку неможливо зрушити з місця. Оцінка показує вам, де ви й ця стратегія розходитесь, роздача за роздачею. Що ви з цим робите – і є справжнім тренуванням.

Теги

  • gto training
  • poker verdicts
  • mixed strategy
  • expected value
  • poker feedback
  • home game

20 роздач на день, безкоштовно

Почніть тренуватися з перевіреними стратегіями та AI-коучингом. Перші 20 роздач безкоштовно, щодня.

Почати безкоштовне тренування

Кредитна картка не потрібна. Безкоштовно назавжди.