GPT
D

DCAD-2000

קוד פתוח

openbmbother2025-03-25

  • multilingual datasets
  • data cleaning
  • multilingualism
  • low-resource languages

מאגר ענק לאימון מקדים של מודלי שפה ביותר ממאה שפות ואלפביתים שונים. תרצו אותו כדי לחלץ טקסט נקי בשפות ספציפיות, כולל עברית וערבית.

  • 9,428הורדות בחודש
  • 23לייקים

מה זה

המאגר מכיל מעל טריליון רשומות שמחולקות לפי שפה ומערכת כתב, למשל עברית בכתב עברי או ערבית באלפבית ערבי. שמות הקבצים מעידים על מקורות רשת רחבים ופרויקטים קיימים, ביניהם fineweb 2 ופרויקט mala.

המבנה הפנימי מפריד בין טקסט שנשמר לבין תוכן שסונן החוצה. לצד קובצי keep שמוגדרים כברירת המחדל לאימון, תמצאו קובצי remove וקובצי stas שמתעדים את מה שהוסר ונתונים סטטיסטיים על הסינון. החלוקה נעשתה ברמת קונפיגורציה ייעודית לכל שילוב של שפה ואלפבית, מה שמאפשר לבודד שפות נדירות יחסית בלי לבלוע אותן בתוך טקסט גלובלי.

מתאים ל

  • אימון מקדים רב לשוני

    אימון מודלי בסיס שדורשים חשיפה למגוון שפות רחב ואלפביתים לא לטיניים.

  • אימון ממוקד לעברית

    משיכת קובצי heb_Hebr בלבד לצורך הרחבת קורפוס טקסט בעברית למודלי שפה.

  • מחקר על סינון תוכן

    השוואה בין קובצי keep לקובצי remove כדי לנתח תהליכי ניקוי וסיווג טקסט.

איפה זה נופל

הכרטיס מציג רק מבנה קבצים ואינו מפרט שום מתודולוגיית סינון, קריטריונים לאיכות, או תאריכי סריקה של הטקסט. חוסר התיעוד הזה מחייב אתכם לדגום את קובצי keep ידנית כדי לבדוק נוכחות של זבל רשתי, תוכן פוגעני או דליפות מידע אישי לפני שאתם שולחים מודל לאימון.

שאלות
נפוצות

האם יש במאגר טקסט בעברית?

כן, קיימת קונפיגורציה ייעודית בשם heb_Hebr שמכילה קובצי jsonl של עברית באלפבית עברי. בנוסף קיים גם תיעוד לקובצי יידיש בשם yid_Hebr.

האם מותר להשתמש במידע למוצר מסחרי?

הרישיון מסומן בתור other ואינו מוגדר כרישיון קוד פתוח סטנדרטי בעמוד. יש לבדוק את קובץ הרישיון המצורף במאגר לפני כל שימוש שאינו מחקרי.

האם חייבים להוריד את כל המאגר?

ממש לא, וגם לא מומלץ לנסות. בגלל שהמאגר מכיל מעל טריליון רשומות, מגדירים בטעינה רק את הקונפיגורציה של השפה שמעניינת אתכם.

איך טוענים

טוענים את המידע ישירות דרך ספריית datasets עם ציון הקונפיגורציה הספציפית שאתם צריכים, למשל heb_Hebr עבור עברית. הורדה מלאה של המאגר כולו כמעט בלתי אפשרית לסביבת עבודה רגילה בגלל 14,789 קבצים והיקף של יותר מטריליון רשומות, כך שחובה לעבוד עם streaming או למשוך רק את התיקייה הרלוונטית. הקבצים שמורים בפורמט jsonl דחוס, הגישה פתוחה בלי צורך בהרשמה מוקדמת, והשדה הקריטי לעבודה מוגדר על קובצי keep.

from datasets import load_dataset

ds = load_dataset("openbmb/DCAD-2000")

הרישיון

הרישיון מוגדר בתור other ומפנה לקובץ מקומי בשם LICENSE בלי לפרט את תנאיו בכרטיס. במצב כזה אי אפשר להניח היתר לשימוש מסחרי, וכל אימון של מודל למוצר מסחרי מסכן אתכם בהפרת זכויות יוצרים עד לקריאה מדויקת של הקובץ המצורף.

הרישיון המלא ב־Hugging Face ↗