GPT
M

MADLAD-400

קוד פתוח

allenaiodc-by2023-09-01

טקסטים נקיים ומפולטרים ברמת המסמך מתוך Common Crawl שמכסים 419 שפות. הוא נבנה עבור מי שצריך אימון מודלים רב-לשוניים בהיקף עצום עם פחות זבל מהרגיל ברשת.

  • 30,193הורדות בחודש
  • 173לייקים

מה זה

המאגר כולל טקסטים מלאים ברמת מסמך שנאספו מכל הסנאפשוטים של Common Crawl עד אוגוסט 2022. הדאטה עבר ניקוי ראשוני שזרק עמודים קצרים מחמישה משפטים, שורות עם פחות משלוש מילים, שגיאות נפוצות כמו לורם איפסום או תגיות תוכנה, ומחק כפילויות של מקטעי שלושה משפטים שחזרו על עצמם ברשת.

התוכן מחולק לשתי גרסאות נפרדות. גרסת clean מסננת מסמכים שבהם יותר מעשרים אחוז מהמשפטים סומנו כבעייתיים בגלל אורכים חריגים, תווים מוזרים, זיהוי שפה לא עקבי או ביטויים מרשימה ייעודית. גרסת noisy כוללת סינון בסיסי בלבד לפי זיהוי השפה השולט במסמך.

מתאים ל

  • אימון מודלי שפה רב-לשוניים

    אימון מודלים על מאות שפות במקביל מתוך טקסטים ברמת מסמך שלם ולא משפטים בודדים.

  • הערכת תרגום בשפות נדירות

    בדיקת איכות מודלים מול עשרות שפות אזוריות ודלות משאבים שאינן קיימות במאגרים רגילים.

  • מחקר על זיהוי שפה

    בחינת עמידות של מסווגי שפה כנגד טקסטים מעורבים ורועשים שנאספו מרחבי הרשת.

איפה זה נופל

בשפות ללא רווחים כמו סינית, תאילנדית וטיבטית, הסינון נכשל בגלל חלוקה שגויה למילים, ולכן גרסת הניקיון שלהן זהה לגרסה המלוכלכת. בשפות רבות עם מעט משאבים המידע מבוסס כמעט כולו על טקסטים דתיים כמו תרגומי תנ״ך ואתרי עדי יהוה, מה שמייצר הטיה סגנונית כבדה. הנתונים נעצרים באוגוסט 2022, ובחלק משפות הודו יש ריכוז גבוה של ספאם ותוכן למבוגרים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח מתיר שימוש מסחרי מלא ללא הגבלה על מכירת מוצרים שנבנו בעזרתו. התנאי היחיד הוא מתן קרדיט מתאים ליוצרים לפי דרישות הרישיון. אין חובה לחלוק את המודל המאומן בקוד פתוח.

כמה טקסט יש בעברית ואיך הוא נראה?

המאגר כולל עברית תחת הקוד iw ומכיל מעל שבעה מיליון מסמכים שנשמרו לאחר הסינון. בדומה לשאר האוסף, מדובר בדפי אינטרנט שלמים מתוך Common Crawl עד אמצע שנת 2022. הטקסט כולל אתרי חדשות, בלוגים ועמודים כלליים שעברו ניקוי מתוכן זבל ומקטעים קצרים.

מה ההבדל בין החלק הנקי לחלק הרועש?

החלק הרועש מכיל עמודים שעברו אך ורק זיהוי שפה ללא בדיקות איכות מעמיקות. החלק הנקי פוסל עמודים עם פחות מחמישה משפטים, או כאלה שמעל חמישית מהמשפטים שלהם מכילים תווים לא תקינים ומילים חשודות. אם אתם מאמנים מודל רגיש לרעש, עדיף להישאר עם הגרסה הנקייה.

למה שפות מסוימות מבוססות בעיקר על טקסטים דתיים?

בשפות נדירות היקף החומר הקיים ברשת מוגבל מאוד, ותרגומי כתבי קודש הם לעיתים המקור היחיד הזמין בהיקף משמעותי. צוות הפרויקט בחר לשמור גם שפות שהכילו עשרים מסמכים בלבד ולא לפסול אותן לחלוטין. המשמעות היא שהמודל שלכם ילמד סגנון ארכאי מאוד אם תאמנו אותו על השפות האלה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בקוד פייתון, ללא צורך בהרשאת גישה מיוחדת. אפשר להגדיר שפה ספציפית בעזרת קוד השפה שלה, או לבחור רשימת שפות וגרסה מבוקשת בין clean לבין noisy. המאגר מבוזר על פני כמעט מאה אלף קבצים, כך שמומלץ למשוך רק את השפות הרלוונטיות לפרויקט ולא להוריד את כולו לדיסק מקומי.

from datasets import load_dataset

ds = load_dataset("allenai/MADLAD-400")

הרישיון

המאגר מופץ תחת רישיון ODC-By, בעוד שבתיאור מצוין גם רישיון CC-BY-4.0. בפועל שני הרישיונות האלה מאפשרים שימוש מסחרי ומחקר חופשי, בתנאי שנותנים קרדיט מלא ליוצרים ומציינים את מקור המידע. אימון מודל על הנתונים אינו מחייב אתכם לפתוח את המשקולות או לשתף את התוצר באותו רישיון.

הרישיון המלא ב־Hugging Face ↗