GPT
C

chess_data

קוד פתוח

Waterhorseapache-2.02023-06-28

המאגר מרכז משחקי שחמט מנותחים לצד טקסט כללי ושיחות, שנאספו כדי לחבר בין מודלי שפה למשחק שחמט. הוא מיועד למי שרוצה לאמן מודלים על מהלכי שחמט, ניתוח משחקים ושיחה על הלוח.

  • 4,648הורדות בחודש
  • 22לייקים

מה זה

המאגר נבנה סביב המחקר של ChessGPT ומחולק לשלושה מקורות עיקריים. החלק הראשון מכיל קובצי PGN מנותחים לצורך אימון ChessCLIP. החלק השני מיועד לבסיס המודל, וכולל משחקי שחמט ממקורות כמו Lichess, CCRL ומאגרי שחקנים מקצועיים, לצד קובצי טקסט ממקורות כמו Wikipedia, C4, RedPajama ו־The Pile. החלק השלישי מיועד לצ'אט וכולל שיחות בנושאי שחמט וטקסטים כלליים ממקורות כמו ShareGPT, Dolly-v2 ו־OpenAssistant.

המבנה של הרשומות תלוי בתת המאגר. חלק מהקבצים מכילים רשומות טקסט עם מטא-דאטה שכולל כותרת, קישור וטקסט גולמי, כמו ערכי ויקיפדיה. קובצי השיחה מכילים מערך של הודעות בין משתמשים עם ציון וקישור למקור. הנתונים לא מגיעים מחולקים מראש לסט אימון ובדיקה.

חלק ניכר מהנתונים המקוריים שמוזכרים במאמר חסר כאן. היוצרים מציינים במפורש שמסיבות משפטיות הם לא שחררו ספרי שחמט, פוסטים מפורומים ומבלוגים, תמלולי יוטיוב ושני מאגרים מסחריים ששימשו לאימון.

מתאים ל

  • אימון מודל שחמט וטקסט

    אימון מודלי שפה שמסוגלים לקרוא מהלכי PGN, להבין חוקים ולנתח עמדות על הלוח.

  • פיתוח צ'אטבוט שחמט

    שימוש בשיחות המוכנות כדי ללמד מודלים לנהל דיון על מהלכים, שגיאות ואסטרטגיה.

  • אימון מודלי ראייה ולוח

    עבודה עם נתוני ChessCLIP כדי לחבר בין מצבי משחק לתיאורים מילוליים.

איפה זה נופל

הנתונים הם בעיקר באנגלית, ואין כאן תוכן בעברית. הבעיה המרכזית היא החוסר במקורות האיכותיים ביותר שנזכרו במחקר. ספרים, בלוגים ותמלולי וידאו הושמטו בגלל ענייני זכויות יוצרים, כך שהתוכן הטקסטואלי הייעודי לשחמט מוגבל בהשוואה למה שהחוקרים אימנו עליו במקור. בנוסף, חלק גדול מהטקסטים הכלליים הם חיתוכים ממאגרי ענק קיימים שלא בהכרח קשורים לשחמט.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון הראשי הוא apache-2.0 והוא מתיר שימוש מסחרי. יחד עם זאת, המאגר מכיל פלטים ממקורות כמו GPT-4 וגזירות מאתרים עם תנאי שימוש מגבילים, ולכן שימוש מסחרי מלא דורש בדיקה משפטית של המקורות הפנימיים.

האם יש במאגר תוכן בעברית?

לא. שפת המאגר המוגדרת היא אנגלית בלבד, וכל הטקסטים והשיחות נאספו ממקורות דוברי אנגלית.

מה ההבדל בין המאגר הזה לבין מה שמתואר במאמר ChessGPT?

המאגר כאן חלקי בלבד. היוצרים הסירו ספרי שחמט, בלוגים, פוסטים מפורומים, תמלולי יוטיוב ושני מאגרים מסחריים בגלל בעיות זכויות יוצרים.

האם הנתונים מגיעים מוכנים עם חלוקה לטסט וטריין?

לא. הנתונים לא מחולקים, ומי שמשתמש בהם צריך לפצל בעצמו את הקבצים לקבוצות אימון, ולידציה ובדיקה.

איך טוענים

המאגר פתוח להורדה ישירה דרך Hugging Face ללא צורך באישור גישה. הוא מחולק ל־461 קבצים, בעיקר בפורמט jsonl מחולק לחלקים וארכיוני tar.gz של PGN. כדי לעבוד איתו צריך לטעון את תת התיקיות הספציפיות שרלוונטיות למשימה, כמו annotated_pgn או c4, ולעבד את שדות ה־text או ה־conversations בהתאם לצורך.

from datasets import load_dataset

ds = load_dataset("Waterhorse/chess_data")

הרישיון

המאגר מפורסם ברישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה תחת ייחוס למקור. עם זאת, הנתונים עצמם נאספו ממגוון רחב של מקורות חיצוניים עם רישיונות שונים, כולל Lichess, Reddit, נתוני GPT-4 ופורומים שונים. מודל שאומן על הנתונים עלול להיות כפוף לתנאי השימוש של אותם מקורות מקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗