GPT
1

101_billion_arabic_words_dataset

קוד פתוח

ClusterlabAiapache-2.02024-04-05

מאגר ענק של טקסט בערבית שחולץ מהרשת ומיועד לאימון מודלי שפה. אם אתם בונים מודל שצריך להבין ערבית סטנדרטית לצד להגים שונים בהיקף רחב, זה מקור גולמי משמעותי.

  • 921הורדות בחודש
  • 73לייקים

מה זה

המאגר מכיל מעל מאה מיליארד מילים בערבית שמקורן בדפי אינטרנט ציבוריים, בעיקר מתוך Common Crawl. הצוות חילץ את התוכן מקובצי WET באמצעות כלי ייעודי שנכתב ברוסט, והעביר את החומר תהליכי ניקוי טקסט והסרת כפילויות לפני הפרסום. החומר מחולק על פני מאות קבצים ולא מופרד מראש לחלוקות אימון או בדיקה מסורתיות.

מבחינת השפה, יש כאן עירוב של ערבית ספרותית מודרנית יחד עם להגים מדוברים שונים, ללא תיוג שמפריד ביניהם. כל רשומה כוללת את גוף הטקסט עצמו, חותמת זמן של התאריך, ומזהה ייחודי. המטרה העיקרית של היוצרים הייתה לייצר בסיס נתונים רחב מספיק לצמצום הפער הקיים במשאבי שפה פתוחים עבור השפה הערבית.

מתאים ל

  • אימון מקדים של מודלי שפה

    הזנת כמויות גדולות של טקסט גולמי בערבית למודל בסיס בשלב האימון הראשוני.

  • כוונון עדין למשימות יצירה

    התאמת מודלים קיימים ליצירת תוכן שוטף בערבית ספרותית ולהגים נפוצים.

  • מחקר בלשני על טקסט רשת

    ניתוח תפוצה של מבנים דקדוקיים ושילוב להגים במרחב האינטרנטי הערבי.

איפה זה נופל

מכיוון שהטקסט מגיע ישירות מסריקת אתרים, הוא מכיל את כל ההטיות, הרעשים והטעויות הנפוצים ברשת הפתוחה. המאגר אינו מתאים למי שזקוק להבנה מדויקת של ניואנסים תרבותיים או להגים ספציפיים בלי עיבוד וסינון נוסף מצדכם. כמו כן, אין כאן מידע אישי או רגיש שמסומן מראש, ונדרשת בדיקה קפדנית של התוכן לפני שמשלבים אותו במוצר שמייצר טקסט למשתמשי קצה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מוצרים שמוצעים ללקוחות בתשלום. החובה היחידה היא לכלול את תנאי הרישיון והקרדיט למפרסמים בקוד או בתיעוד המוצר.

האם יש במאגר טקסטים בעברית?

לא, המאגר מוגדר וממוקד כולו בשפה הערבית, תוך שילוב של ערבית סטנדרטית מודרנית ולהגים שונים. תהליך החילוץ סינן מראש תוכן שאינו בערבית.

איך המידע נאסף וסונן?

הנתונים נאספו מתוך קובצי WET של Common Crawl באמצעות קוד ייעודי ברוסט. לאחר מכן הטקסט עבר תהליכי ניקוי ראשוניים והסרת כפילויות על ידי צוות המפתחים.

באיזה פורמט הקבצים מגיעים?

הנתונים מחולקים ל־481 קובצי jsonl. בכל שורה יש מסמך בודד הכולל את הטקסט, חותמת זמן ומזהה ייחודי.

איך טוענים

המאגר מחולק ל־481 קובצי jsonl ואינו דורש אישור גישה מיוחד כדי להוריד אותו. כל שורה מכילה מפתחות עבור text, date ו־uuid. קחו בחשבון שמדובר בהיקף עצום של מאה מיליארד מילים, כך שמומלץ לעבוד בהזרמה ישירה ולא לנסות לטעון הכל לזיכרון המקומי בבת אחת.

from datasets import load_dataset

ds = load_dataset("ClusterlabAi/101_billion_arabic_words_dataset")

הרישיון

המאגר משוחרר תחת רישיון apache-2.0, מה שמתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. התנאי המרכזי הוא מתן קרדיט ושמירה על הודעת הרישיון המקורית, ללא חובה לשתף את התוצרים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗