GPT
R

roberta-base-finetuned-chinanews-chinese

קוד פתוח

uerרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

פתרון מוכן לסיווג נושאי של חדשות בסינית. מתאים למי שצריך תיוג אוטומטי של טקסטים עיתונאיים בלי לאמן מודל מאפס.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 19,463הורדות בחודש
  • 76לייקים

מה זה

מדובר במודל שמבוסס על RoBERTa בסיסי עם 12 שכבות, שעבר כוונון ייעודי על נתוני Chinanews שנאספו במסגרת פרויקט Glyph. המטרה שלו מוגדרת וצרה, סיווג פסקאות פתיחה של כתבות חדשותיות בסינית לפי קטגוריות תוכן, כמו למשל פוליטיקה של סין.

הוא חלק מסדרה של חמישה מודלים שאומנו על ידי UER, כאשר האחרים מתמקדים בביקורות צרכנים ובניתוח סנטימנט, וזה ספציפית מכוון לתחום החדשות. כרטיס המודל לא מציג ציוני דיוק או השוואות ביצועים מספריות מול אלטרנטיבות, אלא רק מראה דוגמת הרצה שבה קלט על אירוע פוליטי בבייג'ינג תויג כפוליטיקה בביטחון של כ־72 אחוזים.

מתאים ל

  • סיווג מבזקי חדשות

    מיון מהיר של כותרות ופסקאות פתיחה בסינית לקטגוריות תוכן מוגדרות.

  • סינון פידים בסינית

    ניתוב אוטומטי של תכנים עיתונאיים לאפיקים הרלוונטיים לפי נושא.

  • תיוג ארכיוני עיתונות

    ארגון כמויות גדולות של פסקאות חדשותיות ישנות לפי תחומים בלי מגע יד אדם.

איפה זה נופל

האימון נעשה על פסקאות ראשונות בלבד של כתבות, ולכן על טקסטים ארוכים או מורכבים יותר המודל עלול לפספס. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר להזין כתבות שלמות בלי לחתוך אותן קודם.

מעבר לכך, המודל אומן על סינית בלבד ולא יזהה שום שפה אחרת, כולל עברית או אנגלית. מכיוון שאין בכרטיס פירוט של רשימת הקטגוריות המלאה או מדדי דיוק על סט הבדיקה, תצטרכו לבדוק בעצמכם לאילו נושאים בדיוק הוא מחלק את הטקסטים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לניתוח סנטימנט חיובי או שלילי?

לא. המודל אומן לסווג נושאים של כתבות חדשותיות כמו פוליטיקה, ולא רגשות של כותבים. לסנטימנט בסינית קיימים מודלים אחרים באותה סדרה שאומנו על נתוני ביקורות של JD ו־Dianping.

כמה משאבים צריך כדי להריץ אותו בסביבת ייצור?

מעט מאוד. עם משקל של 1.1 גיגה בייט וארכיטקטורה של 12 שכבות, שרת בסיסי עם מעבד רגיל יספיק לעיבוד של פסקאות בודדות בזמן תגובה מהיר.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.1 גיגה בייט, מה שאומר שהוא רץ בקלות על מעבד סטנדרטי בלי צורך בכרטיס מסך חזק, דרך ספריית transformers הרגילה בפייתון. טוענים אותו כמודל לסיווג רצפים ומריצים ישירות על הטקסט.

בגודל כזה אין טעם לחפש API חיצוני בתשלום, כי עלות ההרצה העצמית זניחה לחלוטין. אם המטרה היא סיווג חדשות כללי ולא ניתוח סנטימנט של מוצרים, זו הגרסה המתאימה מתוך החמש שהועלו באותה סדרה.

from transformers import pipeline

pipe = pipeline("text-classification", model="uer/roberta-base-finetuned-chinanews-chinese")
print(pipe("שלום"))

הרישיון

היוצרים לא ציינו רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שאין היתר ברור להשתמש בו במוצר מסחרי, מה שיוצר סיכון לחברות שרוצות להטמיע אותו בקוד סגור.

הרישיון המלא בעמוד המודל ↗