GPT
A

ArabicText-Large

קוד פתוח

Jr23xd23apache-2.02025-08-24

  • arabic
  • llm
  • nlp
  • language-modeling
  • text-corpus

מאגר טקסטים אנציקלופדי בערבית ספרותית שמיועד לאימון מודלי שפה, עם דגש על סינון איכות קפדני ורישיון פתוח. הוא פותר את בעיית הרעש והלכלוך המאפיינת זחילות רשת המוניות בשפה הערבית.

  • 537הורדות בחודש
  • 69לייקים

מה זה

המאגר כולל 743,288 מאמרים בערבית ספרותית מודרנית בהיקף של כ־244 מיליון מילים. המבנה שלו מורכב מרשומות המכילות מזהה ייחודי, כותרת, טקסט נקי, כתובת מקור ומטא-דאטה שכולל ציון איכות ותאריך עיבוד. הטקסטים מכסים תשעה תחומי תוכן עיקריים, כשהבולטים שבהם הם היסטוריה ותרבות עם עשרים ואחד אחוזים, מדע וטכנולוגיה עם עשרים אחוזים, וגיאוגרפיה עם שמונה עשר אחוזים.

לפי הכרטיס, הנתונים נאספו ממקורות אנציקלופדיים אמינים שעברו ביקורת עמיתים, אם כי המקורות המדויקים עצמם אינם נקובים בשמם. תהליך הסינון כלל הסרת הפניות וסימני ניווט, נרמול ייעודי לאותיות בערבית, והסרת כפילויות באמצעות האש ו־MinHash LSH. סף הקבלה דרש לפחות שבעים אחוז תווים בערבית, מינימום של שלושה משפטים, ציון איכות כולל של ארבעים אחוז לפחות, וסינון של מאמרים קצרים במיוחד שמסומנים כדורשי הרחבה.

מתאים ל

  • אימון מקדים של מודלי שפה

    אימון מודלים מבוססי BERT או GPT על טקסט ערבי ספרותי נקי לצורך הבנת שפה או יצירת טקסט.

  • התאמת תחום למודלים קיימים

    כוונון עדין למודלים רב-לשוניים שדורשים העמקת הידע בנושאי היסטוריה, מדע וגיאוגרפיה בערבית.

  • סיווג טקסטים ונושאים

    בניית מודלים לחלוקת מאמרים לתשע הקטגוריות הקיימות במאגר, כמו פוליטיקה, אמנות ומדע.

איפה זה נופל

המאגר מוגבל כמעט לחלוטין לערבית ספרותית מודרנית ולא כולל דיאלקטים מדוברים כמו ערבית מדוברת מצרית, לבנטינית או מפרצית. האופי האנציקלופדי שלו אומר שהוא לא מייצג שיחות יומיומיות, סלנג או טקסטים מרשתות חברתיות. תמונת הידע מוגבלת לחודש ינואר 2025. בנוסף, אף שהציון הממוצע עומד על 58.3 אחוזים, מעל ארבעים אחוז מהרשומות מוגדרות ברמת איכות בינונית של ארבעים עד שישים אחוז בלבד, ולכן חובה לסנן לפי שדה האיכות לפני שימוש במודל שנועד לפרודקשן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי בישראל?

כן. המאגר מפורסם תחת רישיון Apache 2.0, שמתיר שימוש מסחרי מלא כולל אימון מודלים קנייניים. החובה היחידה היא לשמור על הצהרת זכויות היוצרים והייחוס למחבר המקורי.

כמה מקום צריך לפנות בדיסק עבור המאגר?

הקובץ הדחוס שוקל כ־2.8 גיגה-בייט. במאגר Hugging Face הוא מחולק לשישה קובצי Parquet, כך שהטעינה יעילה ולא דורשת משאבי אחסון חריגים בהשוואה למאגרי ענק אחרים.

האם המאגר כולל טקסטים בעברית?

לא. המאגר מוגדר ומיועד באופן בלעדי לשפה הערבית, כאשר רמת הטוהר של השפה עומדת על 94.2 אחוזים תוכן בערבית ספרותית.

במה הוא שונה ממאגרים גדולים יותר כמו OSCAR או mC4?

מאגרי ענק כמו OSCAR כוללים מיליארדי מילים מזחילת רשת כללית ומכילים המון רעש, פרסומות וטעויות. המאגר הזה קטן בהרבה, 244 מיליון מילים בלבד, אך הוא מבוסס על תוכן אנציקלופדי שעבר ניקוי קפדני וסינון כפילויות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets של Hugging Face ללא צורך באישור גישה או מפתח מיוחד. הקבצים שמורים במאגר בפורמט Parquet המחולק לשישה חלקים, ובנוסף קיים ייצוג כקובץ JSONL דחוס בנפח של 2.8 גיגה-בייט. השדות המרכזיים לעבודה הם text עבור תוכן המאמר ו־title עבור הכותרת. כדאי לשים לב לשדה quality_score בתוך המטא-דאטה, שמאפשר לסנן את החלק העליון של הנתונים לפני שמזרימים אותם לתהליך האימון.

from datasets import load_dataset

ds = load_dataset("Jr23xd23/ArabicText-Large")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, מחקרי ושינוי של הנתונים ללא עלות. אין דרישה לשתף תוצרי מודלים תחת אותו רישיון, כך שאפשר לאמן עליו מודלים פנימיים או מסחריים סגורים. התנאי העיקרי הוא מתן קרדיט ושמירה על הודעת זכויות היוצרים של היוצר, ג'אבר ג'אבר מחברת RightNow AI.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗