GPT
D

domain-classifier

קוד פתוח

nvidiaapache-2.02024-05-17

  • transformers
  • safetensors
  • deberta-v2
  • pytorch_model_hub_mixin
  • model_hub_mixin

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

מסווג טקסטים מהיר שממיין פסקאות לתוך 26 קטגוריות תוכן מוגדרות מראש. הוא מיועד לסינון וקטלוג של כמויות טקסט אדירות בלי להוציא הון על מודלים ענקיים.

  • 184Mפרמטרים
  • 1.4 GBמשקל הקבצים
  • 8,201הורדות בחודש
  • 100לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת DeBERTa V3 Base עם 184 מיליון פרמטרים. התפקיד שלו פשוט וממוקד מאוד, מקבלים טקסט של פסקה או כמה פסקאות, והוא מחזיר תגית אחת מתוך רשימה סגורה של 26 תחומים, כמו פיננסים, בריאות, ספורט או נושאים רגישים.

האימון נעשה על שילוב של מיליון דגימות מתוך Common Crawl שתויגו דרך ה־API של גוגל, ועוד חצי מיליון ערכי ויקיפדיה. בבדיקות על 105 אלף דוגמאות הוא השיג ציון PR-AUC ממוצע של 0.9873. זה אומר שברוב הקטגוריות ההפרדה שלו מדויקת להפליא, אבל קטגוריות כלליות כמו חדשות קיבלו ציון נמוך יותר של 0.918, איפה שהגבולות בין התחומים פחות ברורים.

מתאים ל

  • סינון דאטה לאימון מודלים

    מיון ראשוני וחלוקה לנושאים של מיליוני דפי אינטרנט כדי להרכיב מאגרי אימון נקיים וממוקדים.

  • זיהוי תוכן למבוגרים

    סינון תוכן רגיש או בוגר מטקסטים חופשיים, תחום שבו המודל קיבל דיוק של 0.999 במדידות.

  • קטלוג מסמכים וכתבות

    תיוג אוטומטי של תכנים נכנסים לתוך קטגוריות אתר קבועות ללא צורך בהגדרה ידנית.

איפה זה נופל

חלון ההקשר עומד על 512 טוקנים בלבד. אם יש לכם מסמכים ארוכים, תצטרכו לחתוך אותם לפסקאות או לסכם אותם לפני, כי המודל לא מסוגל לקרוא מעבר לזה. בנוסף, הוא פולט רק תווית אחת מתוך ה־26, כך שטקסט שעוסק גם ברפואה וגם בחוק יקבל רק סיווג יחיד. נקודת תורפה נוספת היא קטגוריית החדשות, שקיבלה ציון 0.918 בלבד, מה שאומר ששם צפויים יותר פספוסים. לא מוזכרת שום תמיכה בעברית, והאימון התבסס על מקורות באנגלית.

שאלות
נפוצות

האם אפשר לתת למודל לנתח מאמרים שלמים?

לא בבת אחת. חלון ההקשר שלו מוגבל ל־512 טוקנים בלבד, שזה בערך פסקה או שתיים. בשביל מסמכים מלאים תצטרכו להעביר פסקאות נפרדות ולשקלל את התוצאות לבד.

האם הוא מתאים לטקסטים בעברית?

האימון נעשה על דגימות מ־Common Crawl וויקיפדיה באנגלית עם תיוג של גוגל, ולכן סביר מאוד שהוא יתקשה מאוד עם עברית. מומלץ לבדוק אותו על מדגם מקומי לפני שבונים עליו, או לתרגם את הטקסט קודם.

איך מריצים

המשקל הכולל של הקבצים הוא 1.4 גיגה-בייט, כך שלא צריך שרת מפלצתי בשביל להריץ אותו. כל מעבד גרפי פשוט עם כמה גיגה-בייט בודדים של זיכרון יריץ אותו בקלות, ואפשר להריץ אותו גם על מעבד רגיל אם אין עומס של אלפי בקשות בשנייה. הוא עובד ישירות דרך ספריית transformers או כחלק מ־NeMo Curator.

אין סיבה לשלם ל־API חיצוני על סיווג בסיסי כזה. המודל מספיק קטן ויעיל כדי לשבת ישירות בתוך הפייפליין שלכם, לחסוך עלויות קריאה לרשת ולעבד מידע רגיש בלי להוציא אותו החוצה.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/domain-classifier")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים פנימיים או חיצוניים, לשנות את המשקלים ולהפיץ אותם מחדש. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗