GPT
M

mOSCAR

קוד פתוח

oscar-corpuscc-by-4.02024-06-05

קורפוס רב לשוני ומולטימודלי ברמת מסמך שמיועד לאימון מודלים שצריכים טקסט ורמזים חזותיים. הוא מרכז נתונים שחולצו מהרשת עם ניקוי תוכן וטשטוש פנים.

  • 7,432הורדות בחודש
  • 18לייקים

מה זה

מדובר במאגר רב לשוני שנשען על סריקות רשת ברמת המסמך, הכולל טקסט ונתונים מולטימודליים. הרשומות מחולקות לתתי תיקיות לפי שפה ואלפבית, כמו שרואים במבנה השמות ace_Latn או acm_Arab, ונשמרות בקובצי פראקט. בגרסה הנוכחית הושלם החלק של השפה הספרדית, ונוספו מנגנוני זיהוי שפה כדי לשפר את ההתאמה בין המסמך לשפה שיוחסה לו.

הסינון בכרטיס מתמקד בהסרת תוכן רעיל, החלפת רוב המידע המזהה האישי במחרוזות גנריות, ואיתור פנים בתמונות כדי לטשטש אותן לאחר ההורדה. המאגר מציג קואורדינטות פנים מותאמות לתמונות בגודל 256 פיקסלים תוך שמירה על יחס הגובה והרוחב, כך שמי שמוריד את התמונות יכול ליישם את הטשטוש ישירות אצלו.

מתאים ל

  • אימון מודלים מולטימודליים

    שילוב נתוני טקסט ותמונות תוך שימוש בקואורדינטות הפנים המובנות.

  • אימון מודלי שפה רב לשוניים

    שימוש בטקסטים מסוננים ומסווגים לפי שפה ואלפבית לאימון בסיס.

  • מחקר על פרטיות ברשת

    בדיקת איכות ההסרה של מידע מזהה אישי ומנגנוני טשטוש פנים.

איפה זה נופל

הכרטיס מודה שחלק מפרטי המידע האישי רק הוחלפו ברובם ולא נוקו לחלוטין, מה שמחייב בדיקה עצמאית לפני דחיפה למוצר. התמונות אינן מגיעות מטושטשות מראש אלא מסופקות עם קואורדינטות פנים בלבד, כך שחובת הטשטוש בפועל נופלת על מי שבונה את התהליך. מעבר לכך, פרטים טכניים מלאים על שלבי סינון התוכן הרעיל עדיין חסרים ונדחו למאמר עתידי, והנוכחות של שפות ספציפיות כמו עברית לא מצוינת במפורש בכרטיס.

שאלות
נפוצות

האם מותר להשתמש בו למוצר מסחרי?

כן. הרישיון הוא cc-by-4.0, שמאפשר שימוש מסחרי, שינוי והפצה. התנאי היחיד הוא מתן קרדיט ברור ליוצרי המאגר.

האם יש במאגר עברית?

הכרטיס לא מציין במפורש אם עברית קיימת בפנים. יש בו אלפי קבצים לפי שפות ואלפביתים שונים, ולכן תצטרכו לבדוק אם קיימת תיקיית heb_Hebr ברשימת הקבצים לפני ההורדה.

האם התמונות כבר מגיעות מטושטשות?

לא. המאגר מספק קואורדינטות של זיהוי פנים המותאמות לגודל 256 פיקסלים. האחריות להוריד את התמונות ולבצע את הטשטוש בעזרת הנתונים האלה היא שלכם.

איך טוענים

אתם טוענים אותו ישירות דרך ספריית הדאטהסטים של האגינג פייס עם המזהה oscar-corpus/mOSCAR, ללא צורך באישור גישה מיוחד. המאגר כולל 3,241 קבצים בפורמט פראקט, המחולקים לפי שפות, כך שלא מושכים את הכל בבת אחת אלא מגדירים תת קבוצה ספציפית לפי קוד השפה והכתב הנדרשים. מי שרוצה להשתמש בגרסה הקודמת יכול להעביר את הפרמטר revision עם הערך v1.

from datasets import load_dataset

ds = load_dataset("oscar-corpus/mOSCAR")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. אפשר להשתמש בו באופן חופשי, כולל למטרות מסחריות, כל עוד נותנים קרדיט מתאים ליוצרים לפי דרישות הייחוס. אין דרישה לשתף תוצרים או מודלים מאומנים תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗