GPT
D

dclm-dedup

קוד פתוח

Zyphracc2024-10-23

גרסה נקייה מכפילויות של DCLM לאימון מודלי שפה גדולים. זמינה להורדה ישירה למי שרוצה 750 מיליארד טוקנים מסוננים בלי לבזבז כוח חישוב על טקסט שחוזר על עצמו חמש פעמים בממוצע.

  • 6,550הורדות בחודש
  • 22לייקים

מה זה

המקור של הטקסטים הוא Common Crawl, שעבר סינון איכות מבוסס מודל להעדפת דמיון ל־OpenHermes ולדאטהסטים אחרים של instruction tuning. הצוות של Zyphra גילה שבגרסת הבסיס המקורית של DCLM יש קרוב לשמונים אחוז כפילויות, לעיתים באשכולות של עד מיליון עותקים, מכיוון שהסינון המקורי נעשה רק בתוך מקטעים נפרדים ולא רוחבית על כל המאגר.

העיבוד בוצע באמצעות NeMo Curator בעזרת אלגוריתם MinHash LSH עם חתימות מבוססות 25-גרם של תווים וסף דמיון של כ־85 אחוז. המסמכים חוברו לגרף לא מכוון של רכיבים מקושרים, ומכל אשכול כפילויות נבחר מסמך בודד באקראי בעוד שהשאר נמחקו.

התוצאה מצמצמת את המאגר מ־2,949.3 מיליון מסמכים ו־3,854.9 מיליארד טוקנים לכדי 615.2 מיליון מסמכים שמכילים כ־750.3 מיליארד טוקנים לפי gpt-neox. התוכן כולו מאורגן בעשרה מקטעים עולמיים שמחולקים לאלפי קבצי parquet נפרדים.

מתאים ל

  • אימון מקדים של מודלי שפה

    אימון מודלים מבוססי טקסט באנגלית עד היקף של 750 מיליארד טוקנים מנופים מכפילויות.

  • מחקר על השפעת דדופליקציה

    השוואת התנהגות מודל בין אימון על טקסט ייחודי לחלוטין לבין אימון על גרסת הבסיס העמוסה בעותקים.

  • בניית מאגרי אימון מורכבים

    שילוב נתונים נקיים בתוך תערובות אימון גדולות יותר כמו Zyda-2 ללא חשש מניפוח מלאכותי.

איפה זה נופל

המאגר מוגדר מראש עבור השפה האנגלית בלבד, ואינו מספק מענה למודלים בעברית או תמיכה בריבוי שפות. הסינון האגרסיבי השאיר מסמך אקראי מכל אשכול, כך שאין הבטחה שהגרסה שנשמרה היא המלאה או העדכנית ביותר מבין העותקים.

מעבר לכך, יוצרי המאגר מציינים בעצמם שהסרת הכפילויות לא שיפרה את הביצועים במבחני ההערכה של מודלים בהשוואה לאימון על המקור המשוכפל. לא ידוע מה ההשפעות ארוכות הטווח של היעדר הכפילויות על יציבות המודל מעבר לתוצאות המבחנים המיידיות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למטרות מסחריות?

כן, הרישיון המוגדר הוא CC-BY-4 שמאפשר שימוש מסחרי מלא כולל אימון מודלים למוצרים סגורים. כל מה שנדרש מבחינה חוקית הוא מתן קרדיט וייחוס ליוצרים בהתאם לתנאי הרישיון.

כמה שטח אחסון צריך כדי להוריד אותו?

המאגר שוקל כ־2 טרה-בייט בפורמט parquet. מומלץ להיערך עם שטח אחסון פנוי ונפח עבודה מתאים לפני שמתחילים את ההורדה המלאה, או לעבוד בהזרמה ישירה.

האם הדאטהסט כולל טקסטים בעברית?

המאגר מתמקד באנגלית בלבד לפי נתוני המקור ואינו מיועד למשימות בעברית. אם המטרה היא לאמן מודל שמבין עברית, תצטרכו להסתמך על מקורות מידע אחרים.

מה ההבדל בין המאגר הזה לבין DCLM המקורי?

במאגר המקורי נעשה סינון כפילויות חלקי בלבד, מה שהשאיר בו קרוב לשמונים אחוז תוכן כפול. הגרסה הזו מריצה MinHash LSH על כלל המאגר ומספקת 750 מיליארד טוקנים ייחודיים במקום כמעט ארבעה טריליון טוקנים עם כפילויות.

האם אימון עליו יביא לביצועים טובים יותר לעומת המקור?

היוצרים מודים שבדיקות הראו שהסרת הכפילויות לא שינתה משמעותית את ציוני המודלים במבחני ביצועים. היתרון העיקרי הוא חיסכון במשאבי חישוב כשמאמנים על תקציב טוקנים מוגבל, ומניעת שינון של טקסטים שחזרו עשרות פעמים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון על ידי ציון שם המאגר והספליט train, ללא צורך בהרשאה מיוחדת או אישור גישה מראש. נפח ההורדה הכולל עומד על כ־2 טרה-בייט, ומספר הקבצים עולה על שלושה עשר אלף. בגלל המשקל והפריסה של הקבצים מומלץ להזרים את המידע ישירות למכונת האימון או לשמור על אחסון מקומי מהיר וייעודי כדי למנוע צוואר בקבוק בזמן הקריאה.

from datasets import load_dataset

ds = load_dataset("Zyphra/dclm-dedup")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4. מותר להשתמש בו לצרכים מסחריים ולמחקר, לשנות את הנתונים ולבנות עליהם מודלים חדשים. התנאי היחיד הוא מתן ייחוס הולם ליוצרים המקוריים, ואין חובה לשתף את המודל המאומן או את הנגזרות באותו רישיון.

הרישיון המלא ב־Hugging Face ↗