GPT
V

vlt5-base-keywords

קוד פתוח

Voicelabcc-by-4.02022-09-27

  • transformers
  • pytorch
  • safetensors
  • t5
  • text2text-generation

הוא מחלץ מילות מפתח ממוקדות מטקסטים קצרים באנגלית ובפולנית. כדאי לבחור בו כשמחפשים פתרון קל משקל שרץ מקומית ולא דורש מודלי שפה ענקיים לתיוג תוכן.

  • 275Mפרמטרים
  • 2.1 GBמשקל הקבצים
  • 269,097הורדות בחודש
  • 55לייקים

מה זה

מדובר במודל שמבוסס על t5-base ואומן לחלץ ולייצר מילות מפתח מתוך כותרות ותקצירים של מאמרים מדעיים. הוא יודע לשלוף ביטויים שמופיעים ישירות בטקסט, אבל גם לנסח מונחים מופשטים שלא נכתבו בו במפורש, מה שמבדיל אותו מכלים קלאסיים כמו KeyBERT שרק שולפים מחרוזות קיימות.

האימון נעשה על מאגר POSMAC שכולל מעל 216 אלף תקצירים, בעיקר בהנדסה ומדעי החברה. לפי המדדים, הוא עוקף בבירור כלים כמו extremeText ו־KeyBERT ומגיע לדיוק של מעל 0.35 בחמשת המונחים הראשונים. בפועל זה אומר שרוב הביטויים שהוא מייצר באמת רלוונטיים לנושא, גם אם הוא לא תופס את כל המונחים האפשריים.

מתאים ל

  • תיוג תקצירי מחקר

    שליפת מושגי מפתח מדעיים מתוך כותרות ותקצירים באנגלית ובפולנית.

  • אינדוקס מאמרי בלוג

    יצירת תגיות נושא אוטומטיות לפסקאות פתיחה של פוסטים ומאמרים קצרים.

  • שיפור חיפוש פנימי

    העשרת מסמכים במונחים מופשטים שלא נכתבו בגוף הטקסט כדי לאפשר חיפוש חכם.

איפה זה נופל

הוא מוגבל מאוד באורך הקלט. הוא אומן על תקצירים מדעיים, ולכן טקסטים ארוכים צריך לחתוך ידנית לחתיכות קטנות לפני ההזנה. בנוסף, הוא מתוכנת לפלוט רק בין שלוש לחמש מילות מפתח בכל ריצה, כך שלא תוכלו לקבל רשימה ארוכה ומקיפה של נושאים.

השפות הרשמיות שלו הן פולנית ואנגלית. הוא לא אומן על עברית, ולכן לא הייתי משתמש בו לטקסטים בעברית בלי לבדוק קודם אם הטוקנייזר שלו בכלל מזהה את האותיות.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לתייג מסמכים בעברית?

המודל אומן על פולנית ואנגלית בלבד עם מילון ייעודי של 50 אלף טוקנים. הכרטיס מציין שהוא עובד סביר עם שפות נוספות, אבל ללא תמיכה מפורשת בעברית הטוקניזציה תהיה מקוטעת והתוצאות כנראה לא יהיו שמישות.

האם אפשר לתת לו להפיק עשרים מילות מפתח למאמר שלם?

לא באופן ישיר. המודל מכויל לייצר בין שלוש לחמש מילות מפתח מתוך קטע באורך של תקציר, ואם יש לכם מסמך מלא תצטרכו לפצל אותו לפסקאות ולהריץ אותו על כל חלק בנפרד.

איך מריצים

טוענים את המשקלים דרך transformers כמודל מסוג T5ForConditionalGeneration. הקבצים שוקלים כ־2.1 גיגה בייט בפורמט float32, כך שכל כרטיס מסך בסיסי עם 4 גיגה זיכרון יחזיק אותו בלי להתאמץ, ואפשר להריץ אותו בקלות גם על מעבד רגיל.

לפי החוקרים, כדי לקבל תוצאות אופטימליות חובה להגדיר בעת ההרצה חיפוש אלומות עם ארבע אלומות וחסימת חזרות של שלושה טוקנים. אין שום סיבה לשלם על API חיצוני למשימה כזאת, המודל מספיק קטן ומהיר להרצה עצמאית בשרת שלכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Voicelab/vlt5-base-keywords")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC BY 4.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו בכל מוצר או תוכנה. הדרישה היחידה היא לתת קרדיט ברור ליוצרים מ־Voicelab ולציין את המאמר שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗