GPT
L

LongWriter-6k

קוד פתוח

zai-orgapache-2.02024-08-13

  • Long Context
  • sft
  • writing

מאגר שמכיל ששת אלפים דוגמאות אימון עם פלטים ארוכים במיוחד, בין אלפיים ל־32 אלף מילים. הוא מיועד למי שרוצה ללמד מודל שפה לייצר טקסטים ארוכים ברצף בלי לקטוע את התשובה באמצע.

  • 1,289הורדות בחודש
  • 205לייקים

מה זה

המאגר כולל 6,000 רשומות המיועדות לכוונון עדין של מודלי שפה, כשהייחוד המרכזי כאן הוא אורך הפלט. רוב הנתונים ברשת מציגים תשובות קצרות יחסית, וכאן כל דוגמה כוללת יצירת טקסט של אלפיים עד 32 אלף מילים ברצף. החומרים מופיעים בשתי שפות בלבד, אנגלית וסינית, ואין פירוט על חלוקה פנימית נוספת בין קטגוריות או נושאים שונים בתוך המאגר.

כרטיס הנתונים לא מפרט מאיזה מקורות אינטרנט או מאגרים אחרים נאספו השאלות והתשובות, וגם לא מציין תהליכי סינון, ניקוי ידני או הסרת תוכן פוגעני שבוצעו לפני הפרסום. המטרה המוצהרת של המידע היא לשבור את מגבלת האורך הטיפוסית של מודלים קיימים, ולאפשר להם לחצות את רף עשרת אלפים המילים בפלט בודד. המפתחים עצמם השתמשו בנתונים האלה כדי לאמן גרסאות ייעודיות של מודלי קוד פתוח מוכרים כמו Llama 3.1 ו־GLM-4.

מתאים ל

  • אימון מודלים לפלט ארוך

    כוונון עדין למודלי שפה כדי שיוכלו לייצר מאמרים שלמים, ספרים או קוד נרחב ברצף.

  • מחקר על אובדן הקשר

    בדיקת ההתנהגות של מודלים כשהם נדרשים לשמור על עקביות לאורך עשרות אלפי מילים.

  • הערכת ביצועי מודלים

    בחינה האם המודל מסוגל לעמוד בהנחיות מורכבות מבלי לעצור את הפלט אחרי אלף מילים.

איפה זה נופל

הנתונים קיימים באנגלית ובסינית בלבד, כך שאין כאן עברית בכלל. מי שבונה מוצר מקומי יצטרך לתרגם את החומר או לאסוף דוגמאות בעצמו. מעבר לזה, הכרטיס לא מספק מידע על תאריכי איסוף התוכן, מידת הדיוק של העובדות בטקסטים הארוכים או הטיות שקיימות במידע. כשמודל מתבקש לייצר עשרות אלפי מילים בלי מידע מבוקר על איכות הטקסט, עולה הסיכון להזיות וחזרתיות מייגעת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי מלא. אתם צריכים רק להשאיר את הצהרת זכויות היוצרים ולתת קרדיט ליוצרים.

האם המאגר כולל טקסטים בעברית?

לא, המאגר מוגדר ומכיל טקסטים באנגלית ובסינית בלבד. אם המטרה היא אימון בעברית, תצטרכו לתרגם את הנתונים או לייצר דוגמאות חדשות.

איך נאספו ונבדקו הנתונים?

דף המאגר לא מפרט את מקור הטקסטים או שיטות הסינון שנעשו עליהם. למידע מעמיק יותר על תהליך ההרכבה צריך לפנות למאמר האקדמי שצורף בקישורים.

איך טוענים

הנתונים יושבים בקובץ בפורמט jsonl בשם long.jsonl לצד קובץ הסבר, וסך הכל יש שלושה קבצים במאגר. הגישה חופשית לחלוטין ואין צורך לבקש הרשאה מיוחדת או להמתין לאישור. אפשר למשוך את הקובץ ישירות באמצעות ספריית המאגרים של Hugging Face בלי הגדרות מסובכות. בגלל שמדובר בטקסטים ארוכים במיוחד של עשרות אלפי מילים לכל רשומה, כדאי לקחת בחשבון שדרישות הזיכרון והאחסון בזמן הטעינה והאימון יהיו כבדות בהרבה ממאגר רגיל של ששת אלפים שורות.

from datasets import load_dataset

ds = load_dataset("zai-org/LongWriter-6k")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המידע ושילוב שלו במוצרים סגורים. התנאי העיקרי הוא מתן קרדיט וייחוס מתאים ליוצרים המקוריים, כולל שמירה על הודעות זכויות היוצרים. אין דרישה לשתף את המודלים שתאמנו תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗