GPT
C

CoT-Collection

קוד פתוח

kaist-aicc-by-4.02023-06-05

אוסף של 1.84 מיליון דוגמאות מנומקות שנועד ללמד מודלים קטנים להסביר שלב אחר שלב. הנתונים מבוססים על Flan Collection ומיועדים לשיפור ביצועי zero-shot ו־few-shot.

  • 1,694הורדות בחודש
  • 163לייקים

מה זה

המאגר כולל 1,837,928 רשומות אימון שמגיעות מ־1,060 משימות שונות שנבחרו מתוך Flan Collection. המשימות מכסות מגוון קטגוריות, בהן הסקת מסקנות בשפה טבעית, מענה לשאלות, מדע, סיווג תוכן רעיל, חשבון, הרצת תוכניות, דיאלוג, אתיקה ושאלות רב-ברירה.

כל רשומה בנויה מארבעה שדות מרכזיים: source שמכיל את הקלט למודל, target שמחזיק את התשובה הסופית, rationale שמספק את שרשרת המחשבה שמסבירה איך להגיע מהקלט לתשובה, ושדה task שמציין מאיזה דאטהסט המקור נלקח. החוקרים אימנו מודלים לייצר קודם את הנימוק, אחריו תגית מפרידה, ורק בסוף את התשובה.

כל הנתונים מרוכזים בפיצול יחיד של train, בלי חלוקה מובנית לולידציה או בדיקה בתוך הקבצים עצמם.

מתאים ל

  • אימון מודלי שפה קטנים

    לימוד מודלים קטנים לייצר שרשרת חשיבה מפורטת לפני הפקת התשובה הסופית.

  • שיפור ביצועי אפס דוגמאות

    כוונון עדין שמטרתו לחזק יכולות פתרון משימות ללא דוגמאות מקדימות ב־prompt.

  • אימון למענה מנומק בשאלות

    הוראת המודל לחשב, להסיק לוגית ולענות על שאלות מדעיות ואתיות בשלבים.

איפה זה נופל

המאגר כולו באנגלית בלבד, כך שהוא לא יעזור ישירות למי שמאמן מודל להסקה בעברית בלי תרגום או עבודה מקבילה. בנוסף, אין בכרטיס פירוט לגבי מודל המקור שייצר את ההסברים, סינון שגיאות או בקרת איכות ידנית על שרשראות החשיבה. מאחר שהנתונים נשענים על Flan Collection וכוללים משימות כמו אתיקה ותוכן רעיל, צריך לבדוק היטב הטיות ותשובות שגויות לפני שדוחפים מודל כזה לשירות פעיל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן. הרישיון המדווח הוא cc-by-4.0, והוא מאפשר שימוש מסחרי מלא. התנאי העיקרי הוא מתן קרדיט ברור לחוקרי KAIST שפרסמו את הדאטהסט.

האם יש במאגר נתונים בעברית?

לא, המאגר הזה מכיל אך ורק טקסטים באנגלית. כרטיס הדאטהסט מציין שיש לפרויקט גרסה רב-לשונית נפרדת תחת השם Multilingual-CoT-Collection, אך המאגר הנוכחי מוגדר לשפה האנגלית בלבד.

מאיפה הגיעו הנתונים ומה גודל הדאטהסט?

המאגר כולל 1,837,928 דוגמאות שנאספו והורחבו מתוך 1,060 משימות שונות ב־Flan Collection. כל דוגמה כוללת קלט, פלט, שרשרת הנמקה ושם המשימה המקורית.

האם הדאטהסט מחולק לערכות אימון ומבחן?

לא. הכרטיס מציג פיצול אחד בלבד של train שמכיל את כל 1.84 מיליון הרשומות. אם אתם רוצים להעריך את המודל, תצטרכו להפריד נתונים למבחן בעצמכם או להשתמש בבנצ'מרק חיצוני.

איך טוענים

טוענים את המאגר ישירות מחיבור לספריית datasets דרך המזהה kaist-ai/CoT-Collection, ללא צורך באישור גישה או הרשמה מיוחדת. הנתונים שמורים בקובץ data/CoT_collection_en.json ומלווים בסקריפט CoT-Collection.py. כדאי לקחת בחשבון שמדובר ביותר מ־1.8 מיליון רשומות טקסט, כך שפריקת ה־JSON דורשת זיכרון עבודה מספק. בעת העיבוד, השדות המרכזיים שמעניינים אתכם הם source, rationale ו־target.

from datasets import load_dataset

ds = load_dataset("kaist-ai/CoT-Collection")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, בתנאי שאתם נותנים קרדיט מתאים ליוצרים ומציינים אם בוצעו שינויים. אין דרישה לשתף תוצרי מודלים תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗