GPT
A

ag_news

קוד פתוח

fancyzhxunknown2022-03-02

טקסטים קצרים מכתבות חדשות באנגלית שמסווגים לארבעה נושאים ברורים. זה מאגר סטנדרטי ונוח שמתאים במיוחד להרצת מבחני השוואה מהירים למודלי סיווג.

  • 77,257הורדות בחודש
  • 193לייקים

מה זה

המאגר מכיל קטעי חדשות באנגלית ומחולק לשני חלקים בלבד, 120,000 דוגמאות באימון ו־7,600 דוגמאות בבדיקה. כל רשומה כוללת שדה טקסט קצר ומספר שמייצג את התווית שלה: אפס לעולם, אחת לספורט, שתיים לעסקים ושלוש למדע וטכנולוגיה.

המקור מבוסס על ComeToMyHead, מנוע חיפוש אקדמי שפעל החל מיולי 2004 ואסף מעל מיליון מאמרים מיותר מ־2,000 מקורות חדשותיים במשך יותר משנה. מתוך המאגר המקורי הזה, החוקר שיאנג ג'אנג יצר את הגרסה הנוכחית ששימשה בסיס למאמר על רשתות קונבולוציה ברמת התו מ־2015. הכרטיס לא מפרט מה בדיוק היו שלבי הניקוי, הסינון או תהליך התיוג הידני מעבר לבחירת הנושאים האלה.

מתאים ל

  • בנצ'מרק למודלי סיווג

    השוואת ביצועים מהירה של ארכיטקטורות סיווג מול תוצאות מוכרות בספרות המחקרית.

  • אימון ראשוני לסיווג טקסט

    בניית מודל בסיסי באנגלית שממיין טקסטים לארבע קטגוריות כלליות.

  • בדיקת צינורות עבודה

    אימות של תהליכי אימון, טוקניזציה ותשתיות נתונים על קובץ קל משקל.

איפה זה נופל

כל הטקסטים נאספו באמצע שנות האלפיים באנגלית בלבד. אין כאן מילה אחת בעברית, והשפה מתארכת סביב אירועים ונושאים מלפני שני עשורים. בנוסף, הכרטיס מסמן במפורש שאין מידע על הטיות, סיכונים חברתיים, מידע אישי ורגיש או פרטי המלקטים. אם המוצר שלכם צריך להבין שיח אקטואלי, שפה מודרנית או סלנג רשת, הנתונים האלה לא יספיקו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ בכלל. הרישיון הרשמי מוגדר כלא ידוע, ובטקסט המקורי מצוין במפורש שהחומר מיועד למחקר ולפעילות שאינה מסחרית בלבד.

כמה שטח אחסון צריך כדי להוריד את המאגר?

קבצי ההורדה שוקלים 31.33 מגה בייט, והמאגר תופס 31.70 מגה בייט לאחר יצירתו. סך הכל תצטרכו כ־63 מגה בייט פנויים בדיסק.

האם המאגר כולל כתבות בעברית?

לא, הנתונים הם באנגלית בלבד. הם נאספו ממקורות חדשות בשפה האנגלית בין השנים 2004 ל־2005.

מאיפה הגיעו הנתונים ומי אסף אותם?

הם נאספו ממנוע החיפוש האקדמי ComeToMyHead שסרק מעל 2,000 מקורות חדשות החל מיולי 2004. הגרסה הזו נבנתה מאוחר יותר על ידי שיאנג ג'אנג עבור מאמר מחקרי מ־2015.

איך טוענים

אין כאן צורך באישור גישה מיוחד, המאגר פתוח להורדה ישירה. הקבצים שמורים בפורמט פרקט וגודל ההורדה עומד על 31.33 מגה בייט, כאשר על הדיסק המאגר המיוצר תופס 31.70 מגה בייט ובסך הכל כ־63 מגה בייט. הטעינה מהירה מאוד ומתאימה לעבודה על כל מחשב פיתוח פשוט בלי חומרה כבדה. המבנה מינימליסטי וכולל רק את השדות text ו־label, כך שלא צריך לבזבז זמן על עיבוד מקדים של עמודות מיותרות או התאמות מסובכות.

from datasets import load_dataset

ds = load_dataset("fancyzhx/ag_news")

הרישיון

הרישיון המוגדר במאגר הוא unknown, ובכרטיס נכתב שדרוש מידע נוסף. עם זאת, בתיאור המקורי של ComeToMyHead צוין שהנתונים מסופקים לצורכי מחקר ולכל פעילות שאינה מסחרית. זה אומר שאי אפשר להשתמש במאגר הזה לפיתוח מוצרים מסחריים בלי להסתכן משפטית, ומודל שאומן עליו עשוי להיות מוגבל לשימוש אקדמי או פנימי בלבד.

הרישיון המלא ב־Hugging Face ↗