GPT
F

falcon-refinedweb

קוד פתוח

tiiuaeodc-by2023-05-07

מאגר ענק של טקסט רשת באנגלית שעבר סינון קפדני והסרת כפילויות מ־CommonCrawl. הוא מיועד לאימון מודלי שפה מאפס כחלופה נקייה יותר לטקסט אינטרנטי גולמי.

  • 75,606הורדות בחודש
  • 953לייקים

מה זה

המאגר מציע חילוץ ציבורי מתוך CommonCrawl הכולל כ־968 מיליון דפי אינטרנט באנגלית, שמיתרגמים ל־500 עד 650 מיליארד תוקנים כתלות בטוקנייזר. כל רשומה מייצגת עמוד רשת ומכילה את הטקסט המעובד, כתובת המקור, מועד הסריקה, מזהה המקטע המקורי ורשימת תמונות עם תיאורי הטקסט שלהן.

הבנייה נעשתה בצורה אוטומטית שמתעדפת גודל בלי תיוג אנושי. התהליך כלל חסימת אתרי מבוגרים ברמת הכתובת, חילוץ טקסט בעזרת trafilatura וזיהוי שפה עם fastText של CCNet. לאחר מכן הופעלו היוריסטיקות לניקוי שורות וסינון איכות, יחד עם הסרת כפילויות אגרסיבית ששילבה התאמות מדויקות והתאמות מטושטשות.

מתאים ל

  • אימון מודלי שפה מאפס

    בניית מודלים גדולים באנגלית על בסיס טקסט רשת שעבר ניקוי והסרת כפילויות ברמה גבוהה.

  • אימון מולטי-מודאלי

    שימוש בטקסט לצד קישורי התמונות ותיאורי ה־alt שחולצו מהעמודים המקוריים.

  • הערכת מודלים במורד הזרם

    בדיקת ערכי הפסד וביצועים של מודלים קיימים מול טקסט אינטרנטי מסונן.

איפה זה נופל

המאגר מכיל אנגלית בלבד ולא מתאים ישירות למי שמחפש טקסט בעברית. מאחר שמדובר בדפי אינטרנט ציבוריים, יש בו מידע אישי מזהה כמו כתובות מייל, מספרי טלפון וכתובות רשת, לצד תוכן רעיל או מוטה שהיוצרים מעריכים כדומה ברמתו למאגר The Pile. בנוסף אין כאן חלוקה מובנית לסט אימון וולידציה, כך שתצטרכו להגדיר חלוקה כזו בעצמכם.

שאלות
נפוצות

האם המאגר כולל טקסט בעברית?

לא, המאגר מוגדר ומסונן עבור השפה האנגלית בלבד. תהליך הסינון כלל סיווג שפה מכוון שהשאיר רק תוכן אנגלי, כך שאינו מתאים לאימון מודלים בשפות אחרות.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן, רישיון ODC-By 1.0 מתיר שימוש מסחרי מלא כל עוד אתם מספקים ייחוס ליוצרים. בנוסף, חובה לוודא שאתם עומדים בתנאי השימוש של CommonCrawl שמהם נשאבו הנתונים.

כמה שטח אחסון צריך כדי להוריד אותו?

ההורדה מכווצת ודורשת כ־500 גיגה בייט של תעבורת רשת. לאחר פריסה מלאה של קובצי ה־Parquet תצטרכו לפחות 2.8 טרה בייט של שטח דיסק פנוי.

מה מייחד אותו לעומת CommonCrawl גולמי?

המאגר עבר צינור עיבוד כבד שכלל סינון אתרי מבוגרים, חילוץ טקסט והסרת כפילויות מדויקות ודומות. התוצאה היא טקסט נקי בהרבה שמגיע לביצועים קרובים למאגרים ערוכים ידנית בלי הצורך לנקות אותו לבד.

איך טוענים

טוענים את המאגר ישירות בעזרת load_dataset מספריית datasets תחת השם tiiuae/falcon-refinedweb ללא צורך באישור גישה. הוא מורכב מ־5,536 קבצים בפורמט Parquet, שוקל כ־500 גיגה בייט להורדה ודורש 2.8 טרה בייט של שטח אחסון מקומי לאחר פריסה. השדות המרכזיים לעבודה הם content עבור הטקסט הנקי, לצד url, timestamp, dump, segment ומערך image_urls למי שבונה מודלים שמשלבים ראייה ממוחשבת.

from datasets import load_dataset

ds = load_dataset("tiiuae/falcon-refinedweb")

הרישיון

החילוץ הציבורי מופץ תחת רישיון ODC-By 1.0, שמתיר שימוש מסחרי ומחקר כל עוד ניתן ייחוס מתאים למפרסמים. הרישיון אינו מחייב שיתוף באותו רישיון עבור המודלים או הנגזרות שתאמנו עליו, אך המשתמשים מחויבים לציית גם לתנאי השימוש של CommonCrawl.

הרישיון המלא ב־Hugging Face ↗