GPT
S

sib200

קוד פתוח

Davlancc-by-sa-4.02024-01-27

  • news-topic
  • sib-200
  • sib200

המאגר כולל סיווג נושאים לידיעות חדשותיות ביותר ממאתיים שפות ואלפביתים שונים. חוקרים בוחרים בו כדי לבחון יכולות הכללה של מודלים על שפות נדירות.

  • 18,824הורדות בחודש
  • 20לייקים

מה זה

המאגר מכיל קטעי טקסט חדשותיים שמתוייגים לפי נושאים, ומיועד כולו למשימות סיווג טקסט. לפי התיעוד הרשמי, הטקסטים נוצרו על ידי מומחים אנושיים, בעוד שהתיוגים עצמם נאספו ממקורות קיימים ולא הופקו מאפס עבור הפרויקט.

המבנה הפנימי מחולק למאות תצורות שונות לפי שפה ומערכת כתב, למשל ערבית או לטינית עבור אותה שפה. כל תצורה כזו מחולקת מראש לקובצי אימון, אימות ובדיקה, בצירוף קובץ ייעודי שמפרט את שמות התוויות הזמינות בכל חלוקה.

הגודל הכולל עומד על בין אלף לעשרת אלפים רשומות, מה שאומר שכל שפה בודדת מכילה נפח קטן מאוד של דוגמאות. זהו מבנה שמכוון מראש לבדיקת ביצועים בתנאי משאבים מוגבלים ולא לאימון מודלי ענק מאפס.

מתאים ל

  • הערכת מודלים רב-לשוניים

    בדיקת ביצועי מודל שפה בסיווג נושאי חדשות על מגוון עצום של שפות במקביל.

  • אימון עם מעט דוגמאות

    ניסויי Few-shot לשפות שאין להן כמעט דאטה מתועד ברשת.

  • מיון ראשוני של ידיעות

    התאמת מודל לזיהוי נושא של כתבות חדשות בעברית או בשפות זרות.

איפה זה נופל

הנפח הזעום לכל שפה מהווה את המגבלה העיקרית, שכן כמות של מאות בודדות של רשומות לשפה לא מאפשרת לאמן מסווג אמין למוצר. הנתונים מוגבלים לתחום החדשות בלבד, ולכן לא ייצגו כתיבה יומיומית, סלנג או שיחות משתמש. מעבר לכך, התיוגים נאספו ממקורות קיימים ללא פירוט על בקרת איכות ידנית, מה שמחייב אתכם לבדוק את התוויות מדגמית לפני שאתם מסתמכים על המדדים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון מאפשר שימוש מסחרי, אך כולל דרישת שיתוף זהה מחייבת. אם תשנו את הדאטהסט או תפיצו מוצר שמבוסס עליו ישירות, תצטרכו לשחרר אותו תחת אותו הרישיון בדיוק. בנוסף, חובה לתת ייחוס ברור ליוצרים המקוריים של המאגר.

האם יש במאגר תמיכה בעברית?

כן, השפה העברית מופיעה ברשימת השפות הנתמכות תחת התיוג הייעודי שלה. יש לה תצורה נפרדת הכוללת חלוקה לקובצי אימון, בדיקה ואימות. עם זאת, כמות הטקסטים בעברית קטנה ותואמת לגודל הכללי של הדאטהסט.

כמה שוקל הדאטהסט ואיך הוא בנוי?

המשקל הכולל קל מאוד מאחר שמדובר בקובצי טקסט בלבד בפורמט TSV. המאגר מכיל 822 קבצים שמחולקים לפי צמדי שפה וכתב שונים. כל שפה כוללת קובצי נתונים בסיסיים וקובץ טקסט שמגדיר את רשימת התוויות.

איך אספו את המידע שמופיע בפנים?

לפי כרטיס המאגר, הטקסטים עצמם נוצרו על ידי מומחי שפה אנושיים. לעומת זאת, תוויות הסיווג לא נוצרו במיוחד אלא נלקחו ממקורות קיימים ברשת. הדאטהסט מתמקד כולו בסיווג נושאים של כתבות וידיעות חדשותיות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית הדאטהסטים באמצעות ציון שם המאגר והתצורה הספציפית של השפה והכתב שמעניינים אתכם, למשל עברית. המאגר פתוח לחלוטין לציבור ואינו דורש אישור גישה מראש או מפתחות ייעודיים. הנתונים מאוחסנים בקובצי TSV פשוטים וקלים מאוד לקריאה, כך שאין צורך בנפח אחסון משמעותי או בהמתנה ארוכה להורדה.

from datasets import load_dataset

ds = load_dataset("Davlan/sib200")

הרישיון

הרישיון הוא CC BY-SA 4.0. מותר להשתמש במידע למטרות מחקר וגם למטרות מסחריות, כל עוד נותנים קרדיט מלא למפרסמים. עם זאת, כל יצירה נגזרת או שינוי שתפיצו חייבים להיות תחת אותו רישיון בדיוק. אם תאמנו מודל ישירות על הנתונים ותרצו להפיץ אותו, סביר מאוד שתצטרכו לשחרר גם אותו תחת אותו רישיון שיתוף זהה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗