GPT
D

distilabel-reflection-tuning

קוד פתוח

gabrielmbmbרישיון לא דווח2024-09-06

  • synthetic
  • distilabel
  • rlaif

מאגר נתונים סינתטי קטן שנועד לאמן מודלים לחשוב ולתקן את עצמם בעזרת תגיות ייעודיות. מי שבונה מודל מנמק ימצא כאן תבנית מובנית לתהליכי חשיבה.

  • 54הורדות בחודש
  • 55לייקים

מה זה

המאגר מציג דוגמאות אימון שנוצרו בכלי distilabel לפי גישת reflection tuning, במטרה לחנך מודל לייצר שלבי חשיבה פנימיים לפני מתן התשובה הסופית. לפי הדוגמה שבתיעוד, כל רשומה כוללת הנחיית מערכת קבועה שמאלצת את המודל לפרק את הבקשה, לזהות עמימות, לבחון חלופות בתוך תגיות reflection ייעודיות, ולהפיק פלט מסודר בתגיות output.

הנתונים נשענים על מתודולוגיית Magpie ליצירת דאטה סינתטי, והמפרסם צירף את קובצי הריצה pipeline.yaml ו־reflection.py שמאפשרים לשחזר את תהליך ההפקה במלואו. המאגר מכיל פיצול יחיד בשם default ולא כולל חלוקה מראש למבחן או אימות.

מתאים ל

  • ניסויי כוונון עדין למחשבה

    בדיקת היתכנות מהירה לאימון מודל על תגיות חשיבה ותיקון עצמי בלי להשקיע במאגרי ענק.

  • שחזור תהליך הפקת דאטה

    הרצת סקריפט ה־distilabel המצורף כדי לבנות מאגר סינתטי דומה בקנה מידה גדול יותר.

  • בדיקת מבנה פרומפטים

    שימוש בתבנית ההנחיה של Magpie כדי לבחון איך מודלים שונים מתמודדים עם דרישות נימוק נוקשות.

איפה זה נופל

מדובר במאגר זעיר של פחות מאלף רשומות, כך שהוא לא מספיק לבדו לאימון מלא של מודל אלא בעיקר לניסוי ראשוני או לבדיקת תקינות של תהליך עבודה. התיעוד בכרטיס דל מאוד ולא מפרט מאילו מודלים נדגמו התשובות, מהם נושאי השאלות, או אם נעשה סינון איכות ידני. בנוסף, כל הדוגמאות המוצגות הן באנגלית בלבד, ואין שום מידע על תמיכה בעברית או על התנהגות המודל בשפות אחרות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

לא מומלץ בכלל. המאגר פורסם ללא שום רישיון מוגדר, מה שמשאיר את כל זכויות היוצרים בידי המפרסם ולא מקנה זכויות שימוש לצד שלישי. שימוש בנתונים כאלה במוצר מסחרי חושף אתכם לסיכון משפטי מיותר.

האם הדאטהסט כולל שאלות ותשובות בעברית?

הכרטיס והדוגמאות מציגים תוכן באנגלית בלבד. לא דווח על נתונים בעברית, ובגלל שמדובר בפחות מאלף רשומות, הסיכוי שיש שם תוכן מקומי אפסי. תצטרכו לתרגם את הפייפליין ולהריץ אותו מחדש כדי לקבל תוכן בעברית.

כמה מקום הדאטהסט תופס וכמה רשומות יש בו?

המאגר כולו מכיל פחות מאלף רשומות ומאוחסן בקובץ parquet יחיד. הנפח שלו זניח לחלוטין ויורד תוך שניות בודדות בכל חיבור רשת סטנדרטי.

איך נוצרו הנתונים שבמאגר?

הנתונים הופקו באופן סינתטי באמצעות חבילת distilabel ובהתבסס על מתודולוגיית Magpie, שמשתמשת במודלי שפה כדי לייצר הנחיות ותגובות מאופס. המפרסם העלה את קובץ הסקריפט reflection.py ואת קובץ ההגדרות pipeline.yaml, כך שניתן לראות בדיוק את תהליך ההרצה.

איך טוענים

טוענים את המאגר דרך ספריית datasets באמצעות הפקודה load_dataset עם המזהה gabrielmbmb/distilabel-reflection-tuning. הגישה פתוחה לחלוטין ללא צורך באישור, והנתונים שמורים בקובץ parquet יחיד תחת תיקיית data, כך שההורדה שוקלת מעט מאוד ומסתיימת מיד. המבנה כולל שדה distilabel_metadata שמכיל את נתוני הקלט המקוריים של יצירת הטקסט, ורצוי לבדוק אותו כדי לחלץ את הטקסט הנקי לפני שמעבירים לאימון.

from datasets import load_dataset

ds = load_dataset("gabrielmbmb/distilabel-reflection-tuning")

הרישיון

היוצר לא הגדיר רישיון במאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בנתונים, לא לצרכים מסחריים ואפילו לא למחקר פרטי, מה שיוצר סיכון ישיר לכל מודל שתאמנו עליהם. אם אתם מתכננים מוצר מסחרי, עדיף לא לגעת בקבצים עצמם אלא להשתמש בסקריפט reflection.py המצורף כדי לייצר נתונים משלכם.

הרישיון המלא ב־Hugging Face ↗