فرآیند تصمیم مارکوف: بهینهترین مسیر فینیش
مدلهای امتیازمحور یک سؤال اشتباه میپرسند. سؤال درست «چه امتیازی بزنم؟» نیست — «چگونه امید ریاضی تعداد نوبت تا فینیش را کمینه کنم؟» است [MOD].
۱. تفاوت دو هدف
| هدف | معیار | نتیجه |
|---|---|---|
| بیشینه‑سازی امتیاز | امتیاز مورد انتظار هر دارت | T20 یا T19 بسته به σ |
| کمینه‑سازی تعداد نوبت | امید ویزیتها تا فینیش | گاهی متفاوت |
🔑 این دو همیشه یکی نیستند — و همین، کل ارزش MDP است.
مثال ساده
از ۲۲۹: - T20 (۶۰) ⇒ باقی‑مانده ۱۶۹ = بوگی ❌ - T19 (۵۷) ⇒ باقی‑مانده ۱۷۲ ✅
سه امتیاز کمتر، اما یک ویزیت صرفه‑جویی.
۲. MDP چیست؟
اجزای مدل
| جزء | در دارت |
|---|---|
| حالت (State) | امتیاز باقی‑مانده |
| کنش (Action) | نقطهای که نشانه میروید |
| انتقال (Transition) | احتمال رسیدن به هر حالت بعدی — از مدل گاوسی σ |
| پاداش (Reward) | منفی یک به‑ازای هر نوبت (چون میخواهیم کمینه کنیم) |
روش حل: تکرار مقدار (Value Iteration)
الگوریتم از حالت پایانی (صفر) شروع میکند و به عقب حرکت میکند تا برای هر حالت ممکن بهترین کنش را پیدا کند.
۳. دستاورد تاریخی
این نخستین تحلیل کامل بازی تحت قوانین عادی و نخستین کاربرد یادگیری تقویتی در استراتژی دارت بود [MOD] [PR]
Baird, Journal of the Operational Research Society, 71(6), 1020–1037
«قوانین عادی» یعنی چه؟
مدلهای قبلی برای ساده‑سازی، برخی قواعد را نادیده میگرفتند. این مدل همه را لحاظ میکند: - قاعدهٔ Bust - الزام فینیش با دبل - ساختار سه‑دارتی ویزیت
۴. تبار تاریخی
| سال | پژوهشگر | مشارکت |
|---|---|---|
| ۱۹۸۲ | Kohler | MDP شاخه‑و‑کران — نخستین برنامه‑ریزی پویا |
| ۱۹۹۷ | Stern & Wilcox | بیشینه‑سازی امتیاز تک‑دارت با توزیع وایبول |
| ۱۹۹۹ | Percy | همان مسئله |
| ۲۰۱۱ | Tibshirani et al. | مدل گاوسی + EM |
| ۲۰۲۰ | Baird | MDP کامل با قوانین واقعی |
| بعد | Haugh & Wang | بازی مجموع‑صفر — لایهٔ حریف |
۵. ورودی مدل: σ شما
MDP بدون مدل مهارت کار نمیکند. ورودی آن، همان σ است:
| مهارت (σ) | نقطهٔ هدف بهینه |
|---|---|
| σ = ۵ mm | مرکز T20 |
| σ ≈ ۲۶٫۹ mm | T19 |
| σ ≈ ۶۴٫۶ mm | پایین‑چپ بولزآی |
💡 پس MDP یک لایه روی مدل گاوسی است — نه جایگزین آن.
چگونه σ خود را برآورد کنید
~۵۰ پرتاب به دبل‑بول + الگوریتم EM — بدون نیاز به ثبت مختصات.
۶. خروجی: سیاست وابسته به حالت
MDP یک جدول عظیم تولید میکند: برای هر امتیاز باقی‑مانده و هر سطح مهارت، بهترین نقطهٔ هدف.
⚠️ مشکل عملی
این جدول قابل حفظ کردن نیست. صدها حالت × چند سطح مهارت.
راه‑حل: قواعد سرانگشتی
از خروجی MDP، سه قاعدهٔ ساده قابل استخراج است:
قاعدهٔ ۱ — بازهٔ ۲۰۰ تا ۲۳۰ همیشه چک کنید T20 شما را روی بوگی نمیاندازد. اعداد Bogey: ۱۶۹، ۱۶۸، ۱۶۶، ۱۶۵، ۱۶۳، ۱۶۲، ۱۵۹ قاعده: ختم به ۲، ۳، ۵، ۶، ۸، ۹
قاعدهٔ ۲ — باقی‑ماندهٔ توان دو ۳۲ (D16) پنج تلاش میدهد؛ ۴۰ (D20) دو تلاش.
قاعدهٔ ۳ — Setup Shot از ۲۲۰ با T20 مسدود ⇒ دبل‑بول ⇒ ۱۷۰ ✅
۷. یافتهٔ ضدشهودی
مدل‑های MDP گاهی پیشنهاد میکنند امتیاز کمتری بزنید — چیزی که هیچ مربی سنتی نمیگوید.
چرا منطقی است
هدف رسیدن به صفر است، نه جمع کردن امتیاز. اگر یک امتیاز کمتر، شما را به موقعیت بهتری برساند، بهینه است.
🔑 این تفاوت بین «بازی امتیازی» و «بازی مسابقهای» است.
۸. لایهٔ بعدی: حریف
MDP فرض میکند شما تنها بازی میکنید. لایهٔ بعدی این را حل میکند:
بازی راهبردی (با در نظر گرفتن امتیاز حریف) ارزش ۰٫۲ تا ۰٫۶ درصد احتمال برد در هر لگ و تا ۲٫۳ درصد در بهترین از ۳۵ دارد [MOD]
سه لایهٔ کامل
مدل گاوسی (σ)
↓
MDP (σ + باقی‑ماندهٔ شما)
↓
بازی مجموع‑صفر (+ امتیاز حریف)
۹. مدلهای مکمل
| مدل | کاربرد |
|---|---|
| مدل بیزی تجربی (دیریکله‑چندجملهای) | برآورد مهارت روی ۶۲ ناحیهٔ هدف با قرض‑گیری قدرت بین بازیکنان |
| رویکردهای مارکوفی به دینامیک لگ | مدل‑سازی جریان لگ |
| مدل Massey وابسته به امتیاز | بهترین در پیش‑بینی نتایج در مقایسهٔ پنج مدل |
۱۰. ⚪ آیندهٔ MDP
سیستمهای امتیازدهی خودکار مختصات دقیق (x, y) میلیونها دارت را تولید میکنند [AD]
بازبرآورد مدل مهارت روی مختصات مشاهده‑شده به‑جای نهفته، هر نتیجهٔ MDP پایین‑دستی را بهبود میدهد [GAP].
یعنی: MDPهای امروز روی σ تخمینی کار میکنند. MDPهای فردا روی σ اندازه‑گیری‑شده.
۱۱. جمعبندی
- MDP امید تعداد نوبت را کمینه میکند، نه امتیاز را بیشینه
- نخستین تحلیل کامل با قوانین واقعی — شامل Bust و الزام دبل
- ورودی: σ شما — پس ابتدا آن را برآورد کنید
- خروجی یک جدول عظیم است — اما سه قاعدهٔ ساده از آن استخراج میشود
- گاهی امتیاز کمتر بهینه است
- لایهٔ بعدی: حریف (۰٫۲–۰٫۶٪ در هر لگ)
❓ پرسشهای متداول
MDP در دارت چیست؟ مدلی که امید تعداد نوبت تا فینیش را کمینه میکند — با در نظر گرفتن پراکندگی پرتاب شما.
تفاوتش با بیشینه‑سازی امتیاز چیست؟ گاهی امتیاز کمتر شما را زودتر به فینیش میرساند. مثال: از ۲۲۹، T19 بهتر از T20 است.
آیا باید جدول MDP را حفظ کنم؟ خیر. سه قاعدهٔ سرانگشتی کافی است: بازهٔ ۲۰۰–۲۳۰، باقی‑ماندهٔ توان دو، Setup Shot.
MDP به چه ورودی نیاز دارد؟ σ شما — که با ~۵۰ پرتاب به بولزآی و الگوریتم EM قابل برآورد است.
تکرار مقدار چیست؟ الگوریتمی که از حالت پایانی شروع میکند و به عقب حرکت میکند تا برای هر حالت بهترین کنش را بیابد.
📚 منابع
- Baird — Journal of the Operational Research Society 71(6), 1020–1037: MDP کامل، تکرار مقدار، نخستین کاربرد یادگیری تقویتی [MOD] [PR]
- Kohler (۱۹۸۲) — MDP شاخه‑و‑کران
- Stern & Wilcox (۱۹۹۷)؛ Percy (۱۹۹۹) — توزیع وایبول
- Tibshirani, Price & Taylor — مدل گاوسی و EM [MOD] [PR]
- Haugh & Wang — بازی مجموع‑صفر، ۰٫۲–۰٫۶٪ [MOD]
- مدل بیزی تجربی — ۶۲ ناحیهٔ هدف [MOD]
- Makhamra et al. — مدل Massey وابسته به امتیاز [MOD]
- Darts Checkout Assistant — منطق Setup Shot [PK]
🔗 مطالعهٔ بیشتر
ریاضیات دارت · مدل گاوسی · تعادل نش · راهبرد پرهیز از Bogey · نقشهٔ حرارتی شخصی
جمعآوری شده توسط بابک آقایی | بر پایهٔ سیستم مرجع دانش دارت نسخهٔ ۴.۰ | بازبینی: ۱ اوت ۲۰۲۶