GPT
F

FineWeb2-HQ

קוד פתוח

epfmlodc-by2025-02-17

סינון איכותי של עשרת האחוזים המובילים מתוך FineWeb2 בעשרים שפות שונות. המטרה כאן היא אימון מקדים מהיר פי שישה בהשוואה לדאטה המקורי, תוך שמירה על ביצועים גבוהים.

  • 34,703הורדות בחודש
  • 80לייקים

מה זה

המאגר מכיל מסמכי רשת שנאספו דרך Common Crawl בין השנים 2013 ל־2024, ועברו סינון קפדני. החוקרים השתמשו במסווג שמבוסס על וקטורי שיכון של XLM-RoBERTa כדי לחלץ רק דגימות עשירות בידע ומובנות היטב, והשאירו את העשירון העליון בלבד בכל שפה.

התוכן מחולק לעשרים תת-מאגרים לפי שפה וכתב, מרוסית וסינית עם עשרות מיליוני רשומות, דרך גרמנית, צרפתית וספרדית, ועד שפות כמו ערבית, פרסית וויאטנמית. כל רשומה כוללת את הטקסט המקורי של FineWeb2 יחד עם ציון איכות ומערך וקטורים של 768 ממדים לכל מקטע של 512 טוקנים.

מתאים ל

  • אימון מקדים של מודלי שפה

    בניית מודלי בסיס רב-לשוניים עם תקציב חישוב מוגבל בזכות סינון הנתונים האיכותי.

  • מחקר על בחירת נתונים

    בדיקת השפעת ציוני איכות וסיווג מבוסס שיכונים על ביצועי מודלים בשפות שונות.

  • הערכת ביצועים לשפות זרות

    שימוש בטקסטים מסוננים כמדד להבנת טקסט עשיר בידע בשפות שאינן אנגלית.

איפה זה נופל

עברית חסרה כאן לחלוטין. אם המטרה היא מודל שמבין עברית, אין לכם מה לחפש כאן. בנוסף, למרות שעשו אנונימיזציה לכתובות דואל ו־IP, היוצרים מודים במפורש שקיים מידע מזהה אישי בגלל מקור הנתונים ברשת הפתוחה. הם ממליצים לבצע סינון נוסף לתוכן רגיש ומזיק לפני שדוחפים את זה למוצר, במיוחד כשהדאטה נשען על זחילות ישנות יחסית מ־2013 ועד 2024.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון ODC-By מאפשר שימוש מסחרי מלא, כולל אימון מודלים שמיועדים למכירה. הדרישה העיקרית היא מתן קרדיט מתאים ליוצרים ועמידה בתנאי השימוש של Common Crawl.

האם הדאטהסט כולל טקסטים בעברית?

לא. המאגר מכיל עשרים שפות ספציפיות, ביניהן רוסית, סינית, ערבית וגרמנית, אך עברית אינה נכללת ברשימה הזו. החוקרים ציינו שניתן להרחיב את השיטה לשפות נוספות בעתיד.

כמה מקום אחסון צריך כדי להוריד את הנתונים?

זה תלוי בשפה שתבחרו, שכן המאגר מחולק לקבצים נפרדים. השפות הקטנות יותר כמו ויאטנמית או דנית תופסות סביב 60 ג'יגה-בייט, ואילו שפות גדולות כמו סינית ורוסית מגיעות למאות ג'יגה-בייט ועד 1.2 טרה-בייט.

מה ההבדל בין המאגר הזה ל־FineWeb2 המקורי?

המאגר הזה כולל רק את עשרת האחוזים הטובים ביותר של FineWeb2 בכל שפה, לאחר שעברו דירוג באמצעות מסווג ייעודי. לפי בדיקות החוקרים, הסינון מאפשר להגיע לאותם ביצועי אימון עם פי שישה פחות טוקנים.

איך טוענים

טוענים תת-מאגר ספציפי דרך ספריית datasets בפייתון על ידי ציון שם השפה, למשל deu_Latn. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה בקובצי Parquet, אבל מדובר במשקלי ענק שנעים בין 59 ג'יגה-בייט לוייטנאמית ועד 1.2 טרה-בייט לרוסית. השדות הייחודיים הם quality_score ו־embeddings, ואם אתם לא צריכים את וקטורי השיכון לאימון עצמו, כדאי לסנן אותם כדי לחסוך זיכרון יקר.

from datasets import load_dataset

ds = load_dataset("epfml/FineWeb2-HQ")

הרישיון

הרישיון הוא ODC-By v1.0, שמאפשר שימוש מסחרי, הפצה ושינוי של הנתונים, כל עוד אתם נותנים קרדיט ומייחסים את העבודה ליוצרים. בנוסף, חלים כאן תנאי השימוש של Common Crawl. אין דרישה לשתף תוצרים או מודלים מאומנים תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗