GPT
L

LongForm

קוד פתוח

akoksalmit2023-04-16

הדאטהסט מציע 27,739 דוגמאות אימון באנגלית שנבנו מהפיכת טקסטים אנושיים ארוכים להוראות באמצעות מודלי שפה. הוא מיועד למי שרוצה לאמן מודלים לייצר תשובות מפורטות ומנומקות במקום פלטים קצרים ותמציתיים.

  • 479הורדות בחודש
  • 61לייקים

מה זה

הרשומות במאגר מורכבות מהוראה ומענה ארוך ומפורט. הרעיון המרכזי כאן הוא הנדסה הפוכה, לקחו מסמכים שנכתבו במקור על ידי בני אדם, ומודלי שפה ייצרו עבורם את שאלות ההנחיה המתאימות כדי לייצר זוגות אימון איכותיים.

המקורות מגוונים ומחולקים לשלוש קבוצות עיקריות. הראשונה מבוססת על טקסטים גולמיים של C4 עם עשרת אלפים דוגמאות וויקיפדיה עם חמשת אלפים דוגמאות. השנייה נשענת על מאגרים מובנים, כולל 4,380 דוגמאות מתוך Stack Exchange ו־2,500 מתוך WikiHow. השלישית מרכזת משימות קיימות ממאגרים כמו NIv2, Big Bench, Enron ומשימות תיקון דקדוק של BEA-GEC, שכוללות כתיבת מיילים, שירה וסיכומים.

מבחינת חלוקה, הנתונים מפוצלים מראש לשלושה חלקים ברורים: סט אימון עם 23,652 רשומות, סט ולידציה עם 2,042 רשומות וסט בדיקה עם 2,045 רשומות.

מתאים ל

  • אימון לתשובות ארוכות

    כוונון מודלים ליצירת תשובות עמוקות ומפורטות יותר במקום מענה קצר.

  • כתיבת מיילים וסיכומים

    אימון על משימות ניסוח טקסטים, מיילים, שירים ותיקוני דקדוק באנגלית.

  • פתרון בעיות מעשיות

    לימוד מודלים לפרק מדריכים שלב אחר שלב על בסיס נתוני WikiHow.

  • הערכת ביצועי הנחיה

    בדיקת יכולת המודל לייצר טקסט עשיר בעזרת סטים של מבחן ואימות.

איפה זה נופל

כל הטקסטים במאגר הם באנגלית בלבד, ואין פה נתונים בעברית או בשפות אחרות. מעבר לזה, חלק גדול מההוראות הופק באמצעות מודלי שפה, מה שמכניס רעש סגנוני והטיות שמופיעות באופן קבוע במודלים כאלה. כדאי לזכור שהנתונים פורסמו באפריל 2023, כך שהעובדות והידע בהם אינם מעודכנים. לפני שדוחפים מודל כזה למוצר, צריך לבדוק היטב דיוק עובדתי ובטיחות של הטקסטים שהופקו, בעיקר סביב מקורות כמו Enron ו־C4.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

הרישיון הרשמי הוא MIT, אך ההוראות עצמן נוצרו בעזרת מודלים של OpenAI והחלק של WikiHow כפוף לרישיון האתר. מגבלות אלו עשויות למנוע שימוש מסחרי נקי, ולכן עדיף להיוועץ בייעוץ משפטי לפני שמשלבים אותו במוצר מסחרי.

האם המאגר כולל תמיכה בעברית?

לא, המאגר מוגדר וכולל טקסטים באנגלית בלבד. אם המטרה היא לאמן מודל לפלטים בעברית, המאגר הזה לא יתאים ללא תרגום מקדים.

מאיפה הגיעו הנתונים ואיך בנו אותם?

הטקסטים נלקחו ממקורות אנושיים כמו C4, ויקיפדיה, Stack Exchange, מאגרי מיילים ומשימות NLP מוכרות. החוקרים השתמשו במודלי שפה כדי לייצר את השאלות וההוראות עבור הטקסטים הללו, בתהליך של הנדסה הפוכה.

באיזה פורמט הקבצים מגיעים וכמה מקום הם דורשים?

הנתונים מחולקים לחמישה קבצים, כולל שלושה קובצי Parquet נפרדים לטריין, ולידציה וטסט. מדובר בסך הכל בכ־28 אלף רשומות, כך שהנפח קטן יחסית ונטען במהירות בכל מכונה סטנדרטית.

איך טוענים

הנתונים יושבים בקובצי Parquet סטנדרטיים בחלוקה ל־train, validation ו־test, ללא צורך בהרשאה מיוחדת או אישור גישה מראש. אפשר לטעון אותם ישירות דרך ספריית datasets הרגילה של Hugging Face. המבנה מבוסס על שדות של הוראה (instruction) ופלט (output), כך שהטעינה לתוך סקריפטים קיימים של כוונון עדין פשוטה ומהירה.

from datasets import load_dataset

ds = load_dataset("akoksal/LongForm")

הרישיון

המאגר מוגדר תחת רישיון MIT, אך בפועל יש עליו הגבלות נוספות שמגיעות מתנאי השימוש של OpenAI עקב הפקת ההוראות במודלים שלהם. תת הקבוצה של WikiHow כפופה לרישוי של האתר המקורי, ולכן שימוש מסחרי ישיר במוצר סופי שמאומן על כלל המאגר עשוי להיות מורכב משפטית ודורש בדיקה זהירה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗