GPT
2

20_newsgroups

קוד פתוח

SetFitרישיון לא דווח2022-03-02

אוסף קלאסי של פוסטים מקבוצות דיון שמחולקים לעשרים נושאים שונים. הגרסה הזו מגיעה אחרי ניקוי של כותרות וחתימות, כדי שתוכלו לאמן מודלים לסיווג טקסט בלי רעשי רקע טכניים.

  • 7,705הורדות בחודש
  • 21לייקים

מה זה

המאגר כולל סביב 18,000 פוסטים שנאספו מקבוצות דיון ברשת Usenet, מחולקים לעשרים קטגוריות תוכן שונות. הוא מבוסס ישירות על המימוש המוכר של Scikit-learn ומחולק מראש לשני חלקים, אימון ובדיקה. החלוקה ביניהם נקבעה לפי תאריך הפרסום המקורי של ההודעות, כך שהבדיקה מדמה הגעה של הודעות חדשות בזמן אמת.

צוות SetFit סינן את הטקסטים לפי ההמלצות המקובלות. הם הסירו מכל הודעה את שדות הפתיחה הטכניים, את החתימות בסוף ואת הציטוטים של הודעות קודמות. זה משאיר בעיקר את גוף הטקסט עצמו, בלי רמזים מזהים שיכולים להטות את המודל.

מתאים ל

  • בדיקת מודלים לסיווג

    הערכת ביצועים של מודלים חדשים על בעיית סיווג מוכרת של 20 מחלקות.

  • אימון בשיטת מעט דוגמאות

    בחינת יכולות של ספריות כמו SetFit על טקסטים נקיים מחתימות.

  • השוואת ביצועים היסטורית

    בדיקה מול תוצאות עבר של אלגוריתמים קלאסיים שהתאמנו על Scikit-learn.

איפה זה נופל

הנתונים מגיעים מקבוצות דיון ישנות מאוד, והשפה היא אנגלית בלבד. עברית אין פה בכלל. מעבר לזה, ניקוי הכותרות והחתימות אמנם מונע התאמת יתר של מודלים, אבל הוא גם משאיר לפעמים הודעות קצרות ומקוטעות שקשה לסווג בלי ההקשר המקורי. לא הייתי בונה על זה מודל לטקסטים מודרניים מהרשתות החברתיות בלי לבדוק קודם איך הוא מתמודד עם סלנג עכשווי.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

הרישיון בדף המאגר לא דווח כלל. ללא הצהרת רישיון ברורה, אתם לא יכולים להניח שמותר להשתמש בו למוצרים מסחריים או לאימון מודלים שיימכרו ללקוחות.

האם הדאטהסט כולל טקסטים בעברית?

לא. מדובר בהודעות מקבוצות דיון היסטוריות שנכתבו באנגלית בלבד. אם המטרה היא אימון בעברית, המאגר הזה לא רלוונטי עבורכם.

איך הטקסטים האלה נאספו וסוננו?

הטקסטים נלקחו מהגרסה של Scikit-learn, שמכילה פוסטים מקבוצות דיון של Usenet. יוצרי המאגר הסירו מהם כותרות דואל, חתימות וציטוטים לפי המלצות הסינון המקובלות.

מה ההבדל בין הגרסה הזו לגרסה הרגילה ב־Scikit-learn?

הגרסה הזו ארוזה בקובצי JSON Lines ונגישה ישירות דרך Hugging Face. הטקסטים בה כבר עברו את הניקוי שמסיר חתימות וציטוטים כדי לדמות אימון מציאותי יותר.

איך טוענים

טוענים אותו ישירות דרך הספרייה של Hugging Face עם המזהה SetFit/20_newsgroups, בלי שום צורך לבקש אישור גישה מראש. המאגר מכיל חמישה קבצים, כולל קובצי train.jsonl ו־test.jsonl וסקריפט ההכנה create_dataset.py. הפורמט הוא JSON Lines פשוט, כשהשדות המרכזיים שמעניינים אתכם הם תוכן הטקסט של הפוסט והתווית של הנושא שלו.

from datasets import load_dataset

ds = load_dataset("SetFit/20_newsgroups")

הרישיון

הרישיון של המאגר לא דווח בעמוד שלו. כשאין רישיון מוגדר, אי אפשר לדעת בוודאות אם מותר להשתמש בו לצרכים מסחריים, מה תנאי הייחוס, או מה זה אומר על הפצת מודל שאומן עליו. לשימוש מחקרי ובדיקות פנימיות הוא שימושי, אבל למוצר מסחרי צריך לקחת בחשבון את הסיכון המשפטי.

הרישיון המלא ב־Hugging Face ↗