GPT
C

chess-position-evaluations

קוד פתוח

Lichesscc0-1.02024-09-20

  • chess
  • stockfish
  • lichess
  • games

כמעט מיליארד הערכות עמדה של סטוקפיש מלוח הניתוח של ליצ'ס. אם אתם מאמנים מודל להערכת עמדות שחמט או מחפשים רצפי מהלכים מחושבים, זה כנראה המאגר הציבורי הגדול והזמין ביותר שתמצאו.

  • 2,645הורדות בחודש
  • 30לייקים

מה זה

המאגר מכיל 957,860,115 שורות שמייצגות 394,669,566 עמדות שחמט ייחודיות. הנתונים נוצרו ישירות מתוך לוח הניתוח של אתר ליצ'ס, כשהחישובים עצמם רצו בדפדפנים של משתמשים דרך גרסאות שונות של מנוע סטוקפיש. מדובר בגרסה שעברה דה נורמליזציה של המאגר המקורי מבית ליצ'ס.

כל שורה כוללת את העמדה בפורמט מחרוזת FEN חלקי, שמכיל מיקום כלים, תור מי לשחק, זכויות הצרחה ומשבצת הכאה דרך הילוכו. לצד העמדה נשמרים רצף המהלכים המומלץ במבנה UCI, עומק החישוב של המנוע, מספר הצמתים שנבדקו באלפים, והערכת המצב בנקודות או כמספר מהלכים למט.

מתאים ל

  • אימון מודל הערכת עמדות

    לימוד רשתות נוירונים להעריך יתרון בעמדת שחמט ישירות מלוח בפורמט FEN ללא הרצת מנוע כבד בזמן אמת.

  • בניית מנוע שחמט מהיר

    שימוש ברצפי המהלכים המחושבים ובהערכות המוכנות כדי לייצר פונקציית הערכה מהירה למשחקים בזמן אמת.

  • סינון עמדות למחקר טקטי

    שליפת עמדות שבהן יש הערכת מט ודאית לצורך יצירת מאגרי חידות או ניתוח מבנה טקטי של סיומי משחקים.

איפה זה נופל

החישובים בוצעו בדפדפנים של משתמשי האתר ולא בשרת מרכזי מבוקר, ולכן יש שונות גדולה בעומק החישוב ובאיכות ההערכה של כל עמדה. בנוסף רצו שם גרסאות שונות של סטוקפיש לאורך הזמן, כך שהתוצאות בין שורות שונות אינן בהכרח עקביות לחלוטין. שדה העומק מוגדר כמחרוזת ולא כמספר, מה שמחייב ניקוי נתונים לפני עבודה. מחרוזת הלוח חסרה ספירת מהלכים מלאה, ולא מדווח שום מידע על טקסט חופשי, כך שאין כאן שום עיבוד שפה או הקשר בעברית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא נחלת הכלל לחלוטין. מותר לאמן עליו מודלים מסחריים, למכור אותם ולא חלה חובה לחשוף את הקוד שלכם או לתת קרדיט.

איך הנתונים נאספו בפועל?

הנתונים הגיעו ממשתמשים שפתחו את לוח הניתוח באתר ליצ'ס. המנוע סטוקפיש רץ מקומית בתוך הדפדפן של כל משתמש ושלח את תוצאות החישוב של העמדה למאגר.

האם יש במאגר תוכן בעברית או טקסט כלשהו?

לא. המאגר מכיל רק ייצוגי לוח שחמט, רצפי מהלכים טכניים ומספרים של הערכות מנוע. אין בו שום תוכן טקסטואלי או שפות אנושיות.

מה ההבדל בין מספר השורות למספר העמדות?

במאגר יש כמעט מיליארד שורות אבל רק כ־395 מיליון עמדות ייחודיות. ההבדל נובע מכך שעמדות רבות נותחו כמה פעמים בעומקים שונים או על ידי גרסאות שונות של המנוע בדפדפנים שונים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון מקבצי parquet שמחולקים ל־22 קבצים שונים. אין צורך באישור גישה או ברישום מוקדם. לפני שאתם מושכים את כל המאגר למכונה, קחו בחשבון שמדובר בכמעט מיליארד רשומות, כך שהורדה וטעינה של הכל לזיכרון דורשות נפח אחסון משמעותי וכוח עיבוד מתאים. השדות החשובים לעיבוד הם עמדת הלוח והערכת המנוע בנקודות, או שדה המט במצבים שבהם הניצחון כבר ודאי.

from datasets import load_dataset

ds = load_dataset("Lichess/chess-position-evaluations")

הרישיון

המאגר שוחרר ברישיון cc0-1.0, שזה למעשה נחלת הכלל. מותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים ואימון מודלים קנייניים, בלי חובת ייחוס לליצ'ס ובלי דרישה לשתף את המודל או הנגזרות באותו רישיון. מבחינה משפטית, זה הרישיון הכי חופשי שאפשר לבקש עבור נתוני אימון.

הרישיון המלא ב־Hugging Face ↗