GPT
R

recycling_the_web

קוד פתוח

facebookcc-by-nc-4.02025-07-21

  • synthetic_data
  • LLM_pretraining
  • guided_rewriting

המאגר מכיל 44.4 מיליארד טוקנים סינתטיים שנוצרו על ידי שכתוב טקסטים מהרשת באמצעות מודל שפה. הוא מיועד למי שרוצה להרחיב את מאגר האימון המקדים בלי להסתמך רק על תוכן אנושי.

  • 2,190הורדות בחודש
  • 68לייקים

מה זה

החומר מתבסס על DCLM-RefinedWeb, מסמכים שנאספו מ־Common Crawl ועברו סינונים מבוססי חוקים כמו הסרת כפילויות, אורך דף וכתובות, אך נפסלו מלהיכנס למאגרים מובילים בגלל איכות נמוכה מדי. החוקרים לקחו את הטקסטים האלה והעבירו אותם עיבוד מחדש דרך Llama-3.3-70B-Instruct. המודל זיהה את מטרת הטקסט המקורי, ביצע תהליך חשיבה מובנה, וכתב מסמך משופר בהתבסס עליו.

לאחר שלב השכתוב בוצע סינון נוסף. נעשה שימוש במסווג fastText כדי לדרג את התוצאות, והמאגר הסופי כולל רק את עשרת האחוזים העליונים של הפלטים שקיבלו את הציון הגבוה ביותר. כל הרשומות במאגר הן התוצרים המשוכתבים והמסוננים בלבד, ללא הטקסטים הגולמיים המקוריים.

מתאים ל

  • אימון מקדים של מודלי שפה

    שילוב הטקסטים לצד דאטהסטים קיימים מהרשת להגדלת נפח הטוקנים באנגלית.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של שכתוב מבוסס מודל על ביצועי מודלים שונים.

  • הערכת תהליכי סינון

    ניתוח היעילות של מסווג fastText על פלטים של מודלי שפה גדולים.

איפה זה נופל

הטקסטים כולם באנגלית, כך שאין כאן שום מענה למי שמחפש נתונים בעברית או בשפות אחרות. הבעיה המרכזית היא שזהו תוכן סינתטי לחלוטין שנוצר על ידי Llama 3.3, ולכן הוא סוחב איתו את ההטיות, הסגנון והטעויות העובדתיות של המודל שיצר אותו. בנוסף, המקורות מגיעים מדפי אינטרנט בינוניים שנפסלו במקור. אם אתם בונים מודל שאמור לדעת עובדות מדויקות או להתמודד עם שפה טבעית אותנטית, הסתמכות יתר על המאגר הזה עלולה לייצר אפקט של הזיות וחזרתיות סינתטית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

לא. המאגר מופץ תחת רישיון CC-BY-NC-4.0 שמגביל את השימוש למטרות לא מסחריות ומחקריות בלבד. בנוסף, חלים עליו תנאי הרישיון של Llama 3.3, כך שהוא אינו מתאים למוצרים מסחריים.

האם יש במאגר נתונים בעברית?

לא. הנתונים מוגדרים באנגלית בלבד. כל הטקסטים הם שכתובים של מסמכים שנבחרו מ־DCLM-RefinedWeb בשפה האנגלית, ולכן המאגר אינו רלוונטי לעבודה על עברית.

איך המאגר נוצר ומה המקור של הטקסטים?

הבסיס הוא מסמכים באיכות בינונית מ־Common Crawl שעברו סינוני חוקים בסיסיים. המודל Llama-3.3-70B-Instruct שכתב אותם מחדש בעזרת שרשרת חשיבה, ורק עשרת האחוזים הטובים ביותר נשמרו לאחר סינון fastText.

האם נדרשת חובת מיתוג למודל שיאומן על הנתונים?

כן. לפי תנאי השימוש של Llama 3.3 שמצוינים בכרטיס, אם אתם מפיצים מודל שאומן או שופר על בסיס הנתונים האלה, שמו חייב להתחיל במילה Llama.

איך טוענים

המאגר מחולק לכמעט אלפיים קבצים דחוסים בפורמט jsonl.zstd, שמסודרים כחלקים ממוספרים. לא נדרש תהליך אישור מיוחד כדי להוריד אותם, אבל תצטרכו תשתית שיודעת להתמודד עם פריסה מקבילית של קובצי zstandard כדי לקרוא את המידע ביעילות. בעבודה עם הנתונים חשוב להביא בחשבון שמדובר בהיקף גדול של עשרות מיליארדי טוקנים, ולכן מומלץ לעבד אותם בהזרמה ישירה לתוך תהליך האימון במקום לפרוס הכל מראש לדיסק המקומי.

from datasets import load_dataset

ds = load_dataset("facebook/recycling_the_web")

הרישיון

הרישיון הוא שילוב בעייתי. הוא מסומן כ־CC-BY-NC-4.0, מה שאוסר שימוש מסחרי מכל סוג ומחייב מתן קרדיט. בנוסף, מכיוון שהטקסטים נוצרו על ידי Llama 3.3, הם כפופים לרישיון של מטא, שמחייב אתכם לקרוא לכל מודל שתאמנו או תשפרו בעזרתם בשם שמתחיל במילה Llama. לחברות שמפתחות מוצרים מסחריים המאגר הזה סגור לחלוטין.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗