GPT
T

t5-base-tag-generation

קוד פתוח

fabiochiuapache-2.02022-05-19

  • transformers
  • pytorch
  • tensorboard
  • safetensors
  • t5

התאמה של t5-base שמייצרת תגיות לטקסט כמשימת יצירת טקסט ולא כסיווג רגיל. הוא חוסך תהליך אימון ארוך אם אתם צריכים תיוג מהיר לתוכן בלוגים ומאמרים.

  • 223Mפרמטרים
  • 512טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 97,006הורדות בחודש

מה זה

במקום להגדיר מראש רשימת קטגוריות סגורה ולפתור בעיית סיווג מרובה תוויות, המודל הזה מתייחס לתיוג כמשימת טקסט לטקסט. הוא קורא את גוף המאמר ופולט מחרוזת של תגיות רלוונטיות, בהתבסס על אימון שנעשה על כחמישים אלף מאמרי Medium. היוצר השתמש בטקסונומיה ידנית של כאלף תגיות כדי להרחיב את הנתונים המקוריים, כך שהתיוג מכסה גם מושגי אב ולא רק מילות מפתח צרות.

בבדיקות המודל השיג ציון ROUGE-1 של 38.6 וציון ROUGE-L של 36.4, עם אורך פלט ממוצע של קצת יותר מ־15 טוקנים. המספרים האלה מראים שהוא מצליח לחזות חלק ניכר מרצפי התיוג המקוריים, אך הוא עדיין מייצר רשימות קצרות וממוקדות ולא תיאורים מפורטים.

מתאים ל

  • תיוג מאמרים באנגלית

    הוא אומן על עשרות אלפי כתבות רשת ויודע לחלץ מילות מפתח מתוך הפסקאות הראשונות של הטקסט.

  • העשרת מנועי חיפוש פנימיים

    פליטת התגיות מאפשרת להוסיף מטא דאטה לתוכן טקסטואלי כדי לשפר יכולות סינון באתרים קיימים.

  • הרצה בקצה ללא GPU כבד

    בזכות גודל של 223 מיליון פרמטרים בלבד, אפשר להריץ אותו ישירות על מעבד של שרת קיים בלי עלויות חומרה.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד. במאמרים ארוכים תצטרכו לקצוץ את התוכן או לשלוח רק את הפתיח, מה שיגרום לו לפספס נושאים שמופיעים בהמשך. בנוסף, הדאטה מבוסס על Medium, פלטפורמה עם הטיה חזקה לתחומי תוכנה, טכנולוגיה וסטארטאפים, כך שעל טקסטים רפואיים או משפטיים הוא צפוי לתת תוצאות לא מדויקות. אין לו אימון על עברית, והוא אומן במשך אפוק אחד בלבד.

שאלות
נפוצות

האם המודל יתייג מאמרים שלמים באורך של כמה עמודים?

לא ישירות. המודל מוגבל ל־512 טוקנים, שזה בערך עמוד אחד של טקסט. כדי לעבוד איתו על מאמרים ארוכים תצטרכו להזין רק את הפסקאות הראשונות, או לחלץ סיכום קצר של התוכן מראש.

אפשר להשתמש בו לתוכן בעברית?

לא מומלץ. בסיס המודל והנתונים שעליהם אומן הם באנגלית בלבד. אם תזינו לו טקסט בעברית, הפלט יהיה שגוי או חסר תועלת לחלוטין.

איך מריצים

עם 223 מיליון פרמטרים ומשקל של 1.7 גיגה בייט בדיוק float32, אפשר להריץ אותו בלי שום בעיה על כרטיס מסך בסיסי או אפילו על מעבד רגיל בשרת פשוט דרך ספריית transformers. הוא קל משמעותית ממודלי שפה מודרניים, ולכן אין שום צורך לשלם על שירותי ענן יקרים רק כדי להפעיל אותו.

אם יש לכם שרת עצמאי או מחשב מקומי, הרצה ישירה שלו תהיה מהירה וזולה בהרבה מפנייה ל־API חיצוני. שירות מנוהל שווה בדיקה רק אם אין לכם שרת פעיל בכלל ואתם צריכים לתייג מסמך פעם בשבוע.

from transformers import pipeline

pipe = pipeline("text-generation", model="fabiochiu/t5-base-tag-generation")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או מסחרית בתוך המוצר שלכם. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים ועותק הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗