GPT
S

selfrag_train_data

קוד פתוח

selfragmit2023-10-18

מאגר אימון שנועד ללמד מודלים להחליט בעצמם מתי לחפש מידע חיצוני ולבקר את התשובות שלהם. הוא כולל תגיות בקרה מיוחדות שמוטמעות ישירות בטקסט.

  • 156הורדות בחודש
  • 77לייקים

מה זה

המאגר מכיל כ־150 אלף זוגות של הוראות ופלט שנועדו לאימון מודל השפה בשיטת חיזוי הטוקן הבא. הייחוד כאן הוא שהטקסט שזור בפסקאות מידע שנשלפו ובטוקנים מיוחדים של רפלקציה עצמית, שתפקידם להפעיל את מנגנון השליפה ולבקר את איכות המידע ואת התשובה שנוצרת.

הנתונים מיועדים למשימות יצירת טקסט ומכוונים לגיוון רחב של שאילתות משתמשים. כרטיס הדאטהסט לא מפרט באילו מקורות מידע השתמשו כדי לאסוף את ההוראות או את הפסקאות, וגם לא מציין אילו שלבי סינון וניקוי הופעלו על הטקסט לפני שנארז לקובץ הסופי.

מתאים ל

  • אימון מודלי RAG מבוקרים

    לימוד מודל שפה מתי לגשת למאגר ידע חיצוני ומתי לענות ישירות מהזיכרון.

  • בקרת איכות לתשובות

    אימון המודל לסמן בעצמו האם המידע ששלף רלוונטי והאם התשובה שייצר נכונה.

  • מחקר על תגיות רפלקציה

    בדיקת השפעת שילוב טוקנים מיוחדים של ביקורת עצמית ישירות בתהליך ה־next-token.

איפה זה נופל

הנתונים קיימים באנגלית בלבד. אם המטרה היא מערכת בעברית, המאגר הזה לא יעזור לכם בלי תרגום והתאמה של כל המבנה. מעבר לכך, הכרטיס אינו חושף מאיפה הגיעו הטקסטים, האם יש בהם הטיות מובנות, או מתי בדיוק נאספו. לא כדאי לזרוק אותו לאימון של מוצר סופי בלי לבדוק קודם מדגמית מה טיב המידע בפסקאות ובשאילתות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא mit שמתיר שימוש מסחרי, שינוי והפצה חופשית. הדרישה היחידה היא לכלול את הצהרת זכויות היוצרים המקורית במסמכי הפרויקט שלכם.

האם יש כאן תמיכה בעברית?

לא. המאגר כולו מוגדר ומכיל טקסט באנגלית בלבד. אם אתם בונים מודל שמיועד לשפה העברית, תצטרכו לתרגם את הנתונים או ליצור סט מקביל.

באיזה פורמט המידע שמור ואיך ניגשים אליו?

המאגר מורכב מקובץ train.jsonl פתוח להורדה ישירה דרך Hugging Face. אין צורך בבקשת אישור גישה מיוחדת, ואפשר לטעון אותו בעזרת ספריית datasets הרגילה.

מאיזה מקורות הגיעו הנתונים שבפנים?

דף הדאטהסט לא מפרט את מקורות איסוף הטקסטים או את שיטות הסינון. כדי להבין לעומק איך הדוגמאות נוצרו, תצטרכו לקרוא את המאמר האקדמי שפורסם במקביל.

איך טוענים

הנתונים מגיעים בקובץ train.jsonl שיושב לצד קובץ התיעוד במאגר פתוח לחלוטין, ללא צורך בהרשאת גישה מיוחדת. אפשר לטעון אותו ישירות עם ספריית datasets של Hugging Face. שימו לב שהטקסט כולל תגיות ייעודיות להתנהגות המודל, ולכן תצטרכו להגדיר את הטוקנייזר כך שיכיר את הטוקנים המיוחדים של הפרויקט לפני שמתחילים באימון.

from datasets import load_dataset

ds = load_dataset("selfrag/selfrag_train_data")

הרישיון

המאגר מופץ תחת רישיון mit. זהו רישיון מתירני שמאפשר שימוש מסחרי מלא, שינוי והפצה, בלי דרישה לשתף את התוצרים באותו רישיון. כל מה שצריך זה לשמור על הודעת זכויות היוצרים המקורית. מודל שתאמנו עליו אינו כבול במגבלות פתיחות קוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗