GPT
O

oscar-small

קוד פתוח

nthngdycc0-1.02022-03-23

חילוץ מוקטן מתוך מאגר OSCAR שמיועד לבדיקות של אימון מודלים בסביבות דלות משאבים. הוא מאפשר להריץ בדיקות קונספט בלי להוריד עשרות טראבייטים של טקסט גולמי מהרשת.

  • 5,609הורדות בחודש
  • 17לייקים

מה זה

המאגר מבוסס על סריקת נובמבר 2018 של Common Crawl, מתוכה נשלפו קובצי WET עם טקסט גולמי בלבד. המידע עבר סינון בסיסי ברמת השורה, כולל הסרת שורות קצרות ממאה תווים בקידוד UTF-8 ומחיקת תווים לא תקינים. לאחר מכן הטקסטים סווגו לפי שפות באמצעות מסווג ליניארי של fastText בתוך תשתית שנקראת goclassy, ועברו תהליך של הסרת כפילויות.

התוכן מחולק לקבצים מכווצים לפי קודי שפות, כמו ar לערבית או bg לבולגרית. אין כאן תיוגים, שכבות מטא-דאטה מורכבות או חלוקות מובנות לטריין וטסט, אלא זרם של טקסט רציף שחולץ מאתרי אינטרנט שונים מרחבי העולם.

מתאים ל

  • בדיקת תהליכי אימון מקדימים

    הרצת בדיקות מהירות לצינורות אימון של מודלי שפה לפני מעבר למאגרי ענק יקרים.

  • אימון ייצוגי מילים

    בניית מודלי embedding לשפות שמופיעות במאגר על בסיס טקסט רשת מגוון.

  • הערכת מסווגי שפה

    בדיקת ביצועים של מודלי זיהוי שפה על טקסט אינטרנטי גולמי מרובה מקורות.

איפה זה נופל

הנתונים נאספו מאינטרנט פתוח ישירות מסריקה ישנה של סוף 2018, ללא סינון עמוק של תוכן פוגעני, רעלים או שגיאות עובדתיות. היוצרים מציינים במפורש שהטקסט עלול להכיל מידע אישי ומזהה, מה שמהווה סיכון באימון מודלי שפה שמסוגלים לפלוט נתונים כאלה החוצה. בנוסף, מסווג השפות fastText ידוע כבעל שגיאות סיווג בשפות עם מעט משאבים, כך שחלק מהטקסטים יושבים תחת שפה לא נכונה. עברית בכלל לא מופיעה ברשימת השפות של החיתוך הזה.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. רשימת השפות שפורסמה בדאטהסט הזה כוללת שתים-עשרה שפות בלבד, ביניהן ערבית, בולגרית, בנגלית ואפריקאנס. עברית אינה חלק מהחיתוך הנוכחי.

האם מותר להשתמש בו למוצר מסחרי?

הרישיון של המאגר עצמו הוא CC0, כלומר נחלת הכלל ללא מגבלות על קוד פתוח או סגור. יחד עם זאת, הטקסטים נאספו מאתרים ברשת ללא ויתור זכויות של בעלי האתרים, כך שחברות צריכות להביא בחשבון את הסיכון הכרוך בשימוש במידע שנאסף ב־Common Crawl.

מה ההבדל בין המאגר הזה ל־OSCAR המקורי?

זהו חילוץ מוקטן וספציפי מתוך מאגר הענק המקורי של OSCAR, שכולל במקור מעל 20 טראבייט ו־166 שפות. המטרה כאן היא לספק דגימה קלה להורדה שמדמה סביבת עבודה דלת משאבים לבדיקות מהירות.

כמה המידע שבפנים מעודכן?

הנתונים נלקחו מסריקת הרשת של נובמבר 2018 בלבד. המידע אינו משקף אירועים, שינויי שפה או אתרים שעלו לרשת לאחר מועד זה.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets או מורידים ידנית את קובצי ה־gz של השפה הרצויה מתוך 109 הקבצים שבתיקיית data. אין צורך לבקש אישור גישה מיוחד או לעבור דרך שער סגור, הכל פתוח להורדה ישירה. השדות מכילים טקסט נקי ברצף, כך שכל מה שצריך לעשות הוא לפרוס את הדחיסה ולהזין את השורות ישירות לטוקנייזר או לתהליך האימון שלכם.

from datasets import load_dataset

ds = load_dataset("nthngdy/oscar-small")

הרישיון

האריזה וההפצה שוחררו תחת רישיון נחלת הכלל CC0 1.0, מה שמאפשר שימוש מסחרי ומחקרי מלא בלי חובת ייחוס או דרישה לשיתוף ברישיון זהה. עם זאת, היוצרים מדגישים שאין להם בעלות על זכויות היוצרים של הטקסטים עצמם שנאספו מאתרי אינטרנט. מודל שתאמנו לא מחויב ברישיון פתוח, אך האחריות המשפטית על התוכן המחולץ מאותם אתרים נשארת אצלכם.

הרישיון המלא ב־Hugging Face ↗