GPT
C

chess-puzzles

קוד פתוח

Lichesscc0-1.02024-09-19

  • chess
  • lichess
  • puzzles

מאגר ענק של חידות שחמט מדורגות ומתוייגות עם פתרונות מוכחים ממנועי סטוקפיש. מתאים במיוחד לאימון מודלים להערכת עמדות, חיזוי מסעים וסיווג טקטיקות מתוך משחקים אמיתיים.

  • 2,260הורדות בחודש
  • 40לייקים

מה זה

הנתונים מכילים 6,100,960 חידות שחמט שנשלפו מתוך 300 מיליון משחקים ששוחקו בפועל. היוצרים סיננו וניתחו עמדות מעניינות באמצעות מנועי Stockfish 12 עד 15 בעומק של 40 מגה נודס, תהליך שדרש יותר מ־50 שנות זמן מעבד.

כל רשומה כוללת מזהה ייחודי, לוח בפורמט FEN לפני מסע היריב, ורצף המסעים שמרכיב את הפתרון. הפתרונות מבוססים על מסעים יחידים ששומרים על יתרון, חוץ ממקרי מט במסע אחד שבהם כל מסע מנצח מתקבל. לצד המהלכים יש תגיות טקטיות, פתיחות למשחקים שהתחילו לפני מסע 20, ומספר הפעמים שהחידה שוחקה.

רמת הקושי של כל חידה נקבעת לפי מדד Glicko-2 שנצבר ממשחקי שחקנים מולה באתר, יחד עם סטיית תקן של הדירוג ומדד פופולריות שמחושב מהצבעות שחקנים בין מינוס מאה למאה.

מתאים ל

  • אימון מודל לפתרון עמדות

    לימוד רצף מסעים נכון מתוך מצב לוח נתון לפי סימון FEN.

  • הערכת רמת קושי של טקטיקות

    חיזוי דירוג Glicko-2 של חידה מתוך העמדה והמסעים בלבד.

  • סיווג אוטומטי של תמות

    זיהוי אלמנטים כמו מט או ריתוק על בסיס רצף המהלכים והלוח.

איפה זה נופל

החידות מגיעות ממשחקי אונליין ולא ממשחקים קלאסיים מבוקרים, כך שיש בהן הטיות לטעויות שחקני רשת. התיוג הטקטי נוצר בצורה אוטומטית לפני ששחקנים דירגו אותו, מה שעלול לייצר רעש בסיווג הנושאים. בנוסף, תגיות פתיחה קיימות רק לחידות שהתחילו לפני מסע 20. אין כאן טקסט בשום שפה, כולל עברית, אלא רק סימוני שחמט מקובלים, שמות פתיחות ותוויות באנגלית, כך שזה לא מתאים לעיבוד שפה טבעית רגיל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא CC0 שמשחרר את המידע לנחלת הכלל. מותר לפתח על גביו כלים מסחריים, לאמן מודלים סגורים ולמכור אותם בלי לשלם תמלוגים או לתת קרדיט.

מאיפה הגיעו החידות ומי בדק שהן נכונות?

החידות נגזרו מ־300 מיליון משחקים של Lichess ונותחו מחדש באמצעות Stockfish בגרסאות 12 עד 15. הפתרונות מבוססים על מסעים מוכחים מנועית שבהם כל בחירה אחרת מקלקלת את העמדה.

האם יש במאגר טקסט בעברית?

לא. הנתונים מורכבים מייצוגי לוחות שחמט, רצפי מסעים ושמות תבניות באנגלית. אין פה טקסט חופשי בשום שפה.

איך מחולקים הקבצים בדיסק?

כל המאגר מרוכז בסט נתונים אחד של אימון, ומחולק לשלושה קובצי parquet. אין פיצול מובנה מראש לולידציה או לטסט, וצריך לחלק את המידע לבד.

איך טוענים

טוענים את המאגר ישירות בעזרת הספרייה datasets דרך הנתיב Lichess/chess-puzzles עבור split הטריין. אין צורך לבקש אישור גישה מראש. המידע מחולק לשלושה קובצי parquet, ושדות המפתח לעבודה שוטפת הם FEN עבור מצב הלוח ו־Moves עבור רצף הפתרון. אם רוצים לחזות רמת קושי או נושאים, השדות Rating ו־Themes מספקים את המטרות ללמידה.

from datasets import load_dataset

ds = load_dataset("Lichess/chess-puzzles")

הרישיון

הרישיון הוא CC0 1.0, כלומר נחלת הכלל. מותר להשתמש בנתונים לכל צורך, כולל פיתוח מסחרי ואימון מודלים, בלי חובת ייחוס ובלי דרישה לשתף את הקוד או את הנגזרות באותו רישיון. אין על המודלים שום מגבלה משפטית שנובעת מהמאגר.

הרישיון המלא ב־Hugging Face ↗