GPT
N

naab

קוד פתוח

SLPLmit2022-08-18

קורפוס ענק בפרסית שמאחד מקורות רשת, טלגרם וטקסטים קיימים לתוך 130 ג'יגה בייט נקיים. הוא מיועד למי שרוצה לאמן מודלי שפה בפרסית בלי לבזבז שבועות על זחילת נתונים וסינון ראשוני.

  • 2,918הורדות בחודש
  • 44לייקים

מה זה

כל רשומה היא פשוט פסקה אחת בודדת תחת שדה טקסט יחיד. אין כאן מטא דאטה, תאריכים או תיוגים של נושאים, אלא רצף טקסטואלי נקי בלבד.

היוצרים אספו חומר מחמישה מקורות עיקריים: Persian NLP שכולל בעצמו סריקות Common Crawl וויקיפדיה, מאגר פרטי בשם AGP, חיתוך פרסי מתוך OSCAR, הודעות מערוצי טלגרם בנושאים שונים וטקסט דיבורי ממאגר LSCP. עיבוד הנתונים והסינון נעשו באמצעות כלי פקודה בלינוקס במטרה לחסוך זיכרון ולנקות זבל.

המאגר מחולק לשניים לפי יחס אקראי של 95 אחוז לאימון ו־5 אחוז לבדיקה. חלק האימון שוקל 126 ג'יגה בייט וכולל 225,892,925 פסקאות באורך ממוצע של 61 מילים, וחלק הבדיקה שוקל 2.3 ג'יגה בייט עם 11,083,849 פסקאות באורך ממוצע של 25 מילים.

מתאים ל

  • אימון מודל שפה מאפס

    אימון מקדים של ארכיטקטורות כמו BERT או רשתות ג'נרטיביות על 15 מיליארד מילים בפרסית.

  • התאמת מודלים קיימים לפרסית

    הרחבת אוצר המילים והיכולת הלשונית של מודלים רב-לשוניים באמצעות משימות Masked LM.

  • הערכת ביצועי מודל שפה

    בדיקת איכות של מודלים בפרסית על סט הבחינה הייעודי שמכיל כ־11 מיליון פסקאות.

איפה זה נופל

היוצרים מודים בפירוש שאינם לוקחים אחריות על מידע אישי או רגיש שנמצא בפנים, אלא הסתפקו בערבוב שורות במטרה לקטוע שיחות. הטקסט נאסף ברובו מאתרי אינטרנט ומערוצי טלגרם, ולמרות השילוב של שפה מדוברת מטלגרם ומ־LSCP, עדיין יש הטיה ברורה לכתיבה רשמית. הנתונים פורסמו באוגוסט 2022 ומשקפים את הרשת שלפני כן, ללא אירועים עדכניים. אין כאן שום תוכן בעברית או באנגלית, למעט מה שאולי הסתנן כרעש.

שאלות
נפוצות

האם מותר להשתמש במידע לפיתוח מודל מסחרי?

הרישיון הרשום במאגר הוא MIT, שמתיר שימוש מסחרי חופשי לחלוטין וללא דרישה לשתף את הקוד או המשקולות. עם זאת, בכרטיס המקורי מופיע סימן שאלה לצד שם הרישיון, והחומרים לוקטו ממקורות רשת מגוונים. אם אתם מכוונים למוצר מסחרי עם דרישות משפטיות קפדניות, קחו בחשבון את חוסר הבהירות הזו.

כמה מקום בדיסק צריך כדי לעבוד איתו?

הקבצים דורשים לפחות 130 ג'יגה בייט של שטח אחסון פנוי. חלק האימון לבדו תופס 126 ג'יגה בייט, וחלק הבדיקה תופס 2.3 ג'יגה בייט נוספים. אם אין לכם את הנפח הזה, ניתן לטעון חלקיקי מידע ישירות דרך הספרייה בעזרת פריסת אחוזים.

האם הדאטהסט כולל שפות נוספות מלבד פרסית?

המאגר מיועד ומוגדר כולו לשפה הפרסית בלבד. הוא לא מכיל עברית, והניקוי נועד לסנן שפות זרות ככל האפשר. ייתכנו רק שאריות בודדות של מילים באנגלית או שפות אחרות מתוך ציטוטים וזחילות רשת.

איך החומר נאסף וסונן בפועל?

היוצרים איחדו שמונה קורפוסים מוכרים כמו ויקיפדיה בפרסית ו־Common Crawl יחד עם מאגר AGP, דאטה מ־OSCAR וטקסטים שנזחלו מערוצי טלגרם. לאחר האיסוף, הם העבירו את כל המלל דרך סקריפטים של פקודות לינוקס כדי להסיר כפילויות ולנקות רעשים בצורה חסכונית במשאבים.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה הרשמי, בלי צורך בטפסי בקשה או אישור גישה מוקדם. לפני שמתחילים חייבים לוודא שיש לפחות 130 ג'יגה בייט פנויים בדיסק ורוחב פס יציב, כי ההורדה כבדה מאוד. מי שמוגבל במקום יכול לטעון רק אחוזים בודדים מחלק האימון בעזרת פרמטר החלוקה הרגיל בספרייה. המבנה עצמו שטוח לחלוטין וכולל שדה טקסט יחיד לכל אובייקט.

from datasets import load_dataset

ds = load_dataset("SLPL/naab")

הרישיון

המאגר מוגדר תחת רישיון MIT, אף שבכרטיס מופיע סימן שאלה ליד השם. תחת MIT מותר להשתמש בטקסט לכל מטרה, כולל מסחר ופיתוח מודלים סגורים, בלי חובה לשתף את התוצרים באותו רישיון. החובה היחידה היא לשמור על הצהרת זכויות היוצרים של היוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗