🎯 DartPro
5.9 استراتژی و آنالیتیکس[PR] [MOD] [AD] [PK] [GAP]

فرآیند تصمیم مارکوف: بهینه‌ترین مسیر فینیش

مدل‌های امتیازمحور یک سؤال اشتباه می‌پرسند. سؤال درست «چه امتیازی بزنم؟» نیست — «چگونه امید ریاضی تعداد نوبت تا فینیش را کمینه کنم؟» است [MOD].


۱. تفاوت دو هدف

هدف معیار نتیجه
بیشینه‑سازی امتیاز امتیاز مورد انتظار هر دارت T20 یا T19 بسته به σ
کمینه‑سازی تعداد نوبت امید ویزیت‌ها تا فینیش گاهی متفاوت

🔑 این دو همیشه یکی نیستند — و همین، کل ارزش MDP است.

مثال ساده

از ۲۲۹: - T20 (۶۰) ⇒ باقی‑مانده ۱۶۹ = بوگی ❌ - T19 (۵۷) ⇒ باقی‑مانده ۱۷۲

سه امتیاز کمتر، اما یک ویزیت صرفه‑جویی.


۲. MDP چیست؟

اجزای مدل

جزء در دارت
حالت (State) امتیاز باقی‑مانده
کنش (Action) نقطه‌ای که نشانه می‌روید
انتقال (Transition) احتمال رسیدن به هر حالت بعدی — از مدل گاوسی σ
پاداش (Reward) منفی یک به‑ازای هر نوبت (چون می‌خواهیم کمینه کنیم)

روش حل: تکرار مقدار (Value Iteration)

الگوریتم از حالت پایانی (صفر) شروع می‌کند و به عقب حرکت می‌کند تا برای هر حالت ممکن بهترین کنش را پیدا کند.


۳. دستاورد تاریخی

این نخستین تحلیل کامل بازی تحت قوانین عادی و نخستین کاربرد یادگیری تقویتی در استراتژی دارت بود [MOD] [PR]

Baird, Journal of the Operational Research Society, 71(6), 1020–1037

«قوانین عادی» یعنی چه؟

مدل‌های قبلی برای ساده‑سازی، برخی قواعد را نادیده می‌گرفتند. این مدل همه را لحاظ می‌کند: - قاعدهٔ Bust - الزام فینیش با دبل - ساختار سه‑دارتی ویزیت


۴. تبار تاریخی

سال پژوهشگر مشارکت
۱۹۸۲ Kohler MDP شاخه‑و‑کران — نخستین برنامه‑ریزی پویا
۱۹۹۷ Stern & Wilcox بیشینه‑سازی امتیاز تک‑دارت با توزیع وایبول
۱۹۹۹ Percy همان مسئله
۲۰۱۱ Tibshirani et al. مدل گاوسی + EM
۲۰۲۰ Baird MDP کامل با قوانین واقعی
بعد Haugh & Wang بازی مجموع‑صفر — لایهٔ حریف

۵. ورودی مدل: σ شما

MDP بدون مدل مهارت کار نمی‌کند. ورودی آن، همان σ است:

مهارت (σ) نقطهٔ هدف بهینه
σ = ۵ mm مرکز T20
σ ≈ ۲۶٫۹ mm T19
σ ≈ ۶۴٫۶ mm پایین‑چپ بولزآی

💡 پس MDP یک لایه روی مدل گاوسی است — نه جایگزین آن.

چگونه σ خود را برآورد کنید

~۵۰ پرتاب به دبل‑بول + الگوریتم EM — بدون نیاز به ثبت مختصات.


۶. خروجی: سیاست وابسته به حالت

MDP یک جدول عظیم تولید می‌کند: برای هر امتیاز باقی‑مانده و هر سطح مهارت، بهترین نقطهٔ هدف.

⚠️ مشکل عملی

این جدول قابل حفظ کردن نیست. صدها حالت × چند سطح مهارت.

راه‑حل: قواعد سرانگشتی

از خروجی MDP، سه قاعدهٔ ساده قابل استخراج است:

قاعدهٔ ۱ — بازهٔ ۲۰۰ تا ۲۳۰ همیشه چک کنید T20 شما را روی بوگی نمی‌اندازد. اعداد Bogey: ۱۶۹، ۱۶۸، ۱۶۶، ۱۶۵، ۱۶۳، ۱۶۲، ۱۵۹ قاعده: ختم به ۲، ۳، ۵، ۶، ۸، ۹

قاعدهٔ ۲ — باقی‑ماندهٔ توان دو ۳۲ (D16) پنج تلاش می‌دهد؛ ۴۰ (D20) دو تلاش.

قاعدهٔ ۳ — Setup Shot از ۲۲۰ با T20 مسدوددبل‑بول ⇒ ۱۷۰ ✅


۷. یافتهٔ ضدشهودی

مدل‑های MDP گاهی پیشنهاد می‌کنند امتیاز کمتری بزنید — چیزی که هیچ مربی سنتی نمی‌گوید.

چرا منطقی است

هدف رسیدن به صفر است، نه جمع کردن امتیاز. اگر یک امتیاز کمتر، شما را به موقعیت بهتری برساند، بهینه است.

🔑 این تفاوت بین «بازی امتیازی» و «بازی مسابقه‌ای» است.


۸. لایهٔ بعدی: حریف

MDP فرض می‌کند شما تنها بازی می‌کنید. لایهٔ بعدی این را حل می‌کند:

بازی راهبردی (با در نظر گرفتن امتیاز حریف) ارزش ۰٫۲ تا ۰٫۶ درصد احتمال برد در هر لگ و تا ۲٫۳ درصد در بهترین از ۳۵ دارد [MOD]

سه لایهٔ کامل

مدل گاوسی (σ)
    ↓
MDP (σ + باقی‑ماندهٔ شما)
    ↓
بازی مجموع‑صفر (+ امتیاز حریف)

۹. مدل‌های مکمل

مدل کاربرد
مدل بیزی تجربی (دیریکله‑چندجمله‌ای) برآورد مهارت روی ۶۲ ناحیهٔ هدف با قرض‑گیری قدرت بین بازیکنان
رویکردهای مارکوفی به دینامیک لگ مدل‑سازی جریان لگ
مدل Massey وابسته به امتیاز بهترین در پیش‑بینی نتایج در مقایسهٔ پنج مدل

۱۰. ⚪ آیندهٔ MDP

سیستم‌های امتیازدهی خودکار مختصات دقیق (x, y) میلیون‌ها دارت را تولید می‌کنند [AD]

بازبرآورد مدل مهارت روی مختصات مشاهده‑شده به‑جای نهفته، هر نتیجهٔ MDP پایین‑دستی را بهبود می‌دهد [GAP].

یعنی: MDPهای امروز روی σ تخمینی کار می‌کنند. MDPهای فردا روی σ اندازه‑گیری‑شده.


۱۱. جمع‌بندی

  1. MDP امید تعداد نوبت را کمینه می‌کند، نه امتیاز را بیشینه
  2. نخستین تحلیل کامل با قوانین واقعی — شامل Bust و الزام دبل
  3. ورودی: σ شما — پس ابتدا آن را برآورد کنید
  4. خروجی یک جدول عظیم است — اما سه قاعدهٔ ساده از آن استخراج می‌شود
  5. گاهی امتیاز کمتر بهینه است
  6. لایهٔ بعدی: حریف (۰٫۲–۰٫۶٪ در هر لگ)

❓ پرسش‌های متداول

MDP در دارت چیست؟ مدلی که امید تعداد نوبت تا فینیش را کمینه می‌کند — با در نظر گرفتن پراکندگی پرتاب شما.

تفاوتش با بیشینه‑سازی امتیاز چیست؟ گاهی امتیاز کمتر شما را زودتر به فینیش می‌رساند. مثال: از ۲۲۹، T19 بهتر از T20 است.

آیا باید جدول MDP را حفظ کنم؟ خیر. سه قاعدهٔ سرانگشتی کافی است: بازهٔ ۲۰۰–۲۳۰، باقی‑ماندهٔ توان دو، Setup Shot.

MDP به چه ورودی نیاز دارد؟ σ شما — که با ~۵۰ پرتاب به بولزآی و الگوریتم EM قابل برآورد است.

تکرار مقدار چیست؟ الگوریتمی که از حالت پایانی شروع می‌کند و به عقب حرکت می‌کند تا برای هر حالت بهترین کنش را بیابد.


📚 منابع

  1. Baird — Journal of the Operational Research Society 71(6), 1020–1037: MDP کامل، تکرار مقدار، نخستین کاربرد یادگیری تقویتی [MOD] [PR]
  2. Kohler (۱۹۸۲) — MDP شاخه‑و‑کران
  3. Stern & Wilcox (۱۹۹۷)؛ Percy (۱۹۹۹) — توزیع وایبول
  4. Tibshirani, Price & Taylor — مدل گاوسی و EM [MOD] [PR]
  5. Haugh & Wang — بازی مجموع‑صفر، ۰٫۲–۰٫۶٪ [MOD]
  6. مدل بیزی تجربی — ۶۲ ناحیهٔ هدف [MOD]
  7. Makhamra et al. — مدل Massey وابسته به امتیاز [MOD]
  8. Darts Checkout Assistant — منطق Setup Shot [PK]

🔗 مطالعهٔ بیشتر

ریاضیات دارت · مدل گاوسی · تعادل نش · راهبرد پرهیز از Bogey · نقشهٔ حرارتی شخصی

جمع‌آوری شده توسط بابک آقایی | بر پایهٔ سیستم مرجع دانش دارت نسخهٔ ۴.۰ | بازبینی: ۱ اوت ۲۰۲۶