GPT
L

Lucie-Training-Dataset

קוד פתוח

OpenLLM-Francecc-by-nc-sa-4.02024-10-16

  • text-generation
  • conditional-text-generation

מעל טריליון רשומות שמכוונות בעיקר לצרפתית ואנגלית, עם קצת שפות אירופיות וקוד. מתאים למי שרוצה לאמן מודל שפה עם דגש אירופי חזק ולא מרוכז בארצות הברית בלבד.

  • 12,042הורדות בחודש
  • 39לייקים

מה זה

המאגר מכיל מעל שני מיליארד מסמכים שחולקו למגוון קטגוריות, בהן דפי אינטרנט, ספרים, מאמרים אקדמיים, עיתונות, טקסטים ותמלילים פרלמנטריים, ויקיפדיה וקוד תכנות ממקורות כמו TheStack. המטרה המרכזית באיסוף הייתה לייצר שיווי משקל תרבותי, ולכן יש בו יותר תוכן בצרפתית מאשר באנגלית, לצד כמויות קטנות יותר של גרמנית, ספרדית ואיטלקית. חלק מספרי העיון והעיתונים נסרקו ועברו עיבוד בתוכנות זיהוי תווים אופטי.

תהליך הסינון כלל ניקוי של נתונים באיכות ירודה, הסרת כפילויות לפי שיטות מקובלות בתחום, וסינון רעילות ופרטים מזהים אישיים מטקסטים שנאספו מהרשת. כל דפי האינטרנט נאספו רק מאתרים שקובץ הרובוטים שלהם לא אסר סריקה. כל רשומה כוללת את תוכן הטקסט עצמו לצד מטא-דאטה מגוון: שפת המקור, מזהה ייחודי, מקור המידע, ולעיתים גם קישור מקורי, כותרת, מחבר, תאריך, מידע נוסף ומדדי איכות שחושבו מראש.

מתאים ל

  • אימון מודל רב לשוני

    מתאים לבניית מודל שפה עם שליטה גבוהה בצרפתית ואנגלית, לצד הבנה של שפות אירופיות מרכזיות.

  • מחקר על דאטה אירופי

    מעולה לחוקרים שרוצים לבחון השפעה של שילוב מקורות היסטוריים, פרלמנטריים ומשפטיים על איכות היצירה.

  • אימון מודלי קוד

    אפשר לטעון רק את תתי התיקיות של שפות התכנות מתוך TheStack כדי לשפר יכולות היקש חישובי.

איפה זה נופל

יש פה אפס עברית, כך שהוא לא רלוונטי למי שבונה מודל מקומי לישראל. הטקסטים שהגיעו מסריקות ומסמכים ישנים כוללים שגיאות זיהוי תווים שלא נוקו במלואן. שדה השפה נלקח ישירות מהמקורות ולכן עלול לכלול סיווגים שגויים. בנוסף, תת מאגר אקדמי מפלטפורמת פרסה הוסר מהחבילה בגלל זכויות יוצרים, ולכן חסרים בו מיליארדי טוקנים שמופיעים במודל המקורי.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

לא. הרישיון הנוכחי אוסר שימוש מסחרי מכל סוג ומחייב שיתוף זהה. אם תאמנו עליו מודל, לא תוכלו למכור גישה אליו ותצטרכו לשחרר את המשקלים תחת אותו רישיון מגביל.

האם יש בדאטהסט הזה תוכן בעברית?

אין בו עברית בכלל. המאגר מתמקד בצרפתית ובאנגלית, עם נתחים קטנים בגרמנית, ספרדית, איטלקית וקטעי קוד. לפיתוח מודל בעברית תצטרכו לפנות למקורות אחרים.

איך נאספו הנתונים ומה רמת האיכות שלהם?

החומרים לוקטו מסריקות אינטרנט שעמדו בכללי רובוטים, עיתונים וספרים ברשות הציבור, מאמרים ומאגרי קוד. הצוות סינן כפילויות, רעילות ומידע אישי, אבל חלק מהמסמכים עברו סריקת תווים שמשאירה טעויות בטקסט.

האם הקבצים כוללים את כל המידע ששימש לאימון המודל המקורי?

כמעט כולם, למעט חלק אחד. תת מאגר אקדמי של פלטפורמת פרסה שכולל מיליארדי טוקנים הושמט בגלל בעיות של זכויות יוצרים, והצוות סיפק רק קובצי מטא-דאטה וקישורים כדי להוריד אותו עצמאית.

איך טוענים

הנתונים מחולקים ליותר מתשעת אלפים וחמש מאות קבצי Parquet לפי שפות ומקורות, למשל תתי תיקיות של קוד לפי שפת תכנות. אין צורך באישור גישה מיוחד כדי להוריד את המאגר. בגלל הגודל העצום של מעל שני טריליון טוקנים, מומלץ לא למשוך את הכל בבת אחת אלא להשתמש בהזרמה או לטעון רק את תת הקבוצה הרלוונטית למשימה שלכם. השדות המרכזיים שתרצו לבדוק בכל רשומה הם שדה הטקסט, שדה השפה שמכיל קידומת ייעודית לקוד או צמדי שפות לתרגום, ומדדי האיכות אם אתם מתכננים סינון נוסף.

from datasets import load_dataset

ds = load_dataset("OpenLLM-France/Lucie-Training-Dataset")

הרישיון

הרישיון הוא לא מסחרי ושיתוף זהה. אסור להשתמש בנתונים כדי לבנות מוצר מסחרי, וכל נגזרת או מודל שמאמנים עליו חייבים להיות מופצים תחת אותם תנאים מגבילים בדיוק. המפרסמים ציינו שישחררו תת קבוצה מסחרית בעתיד, אבל המאגר הנוכחי חסום לחלוטין לחברות שרוצות להרוויח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗