GPT
G

gliner2.5-multi-v1

קוד פתוח

fastinoapache-2.02026-08-14

  • gliner2
  • safetensors
  • extractor
  • Text classification
  • Named Entity Recognition

מודל לחילוץ ישויות, קשרים וסיווג טקסט רב-לשוני בריצה מקומית. הוא מאפשר להגדיר סכמה מותאמת אישית ולחלץ מבנים מורכבים במעבר אחד בלי להישען על מודלי שפה ענקיים.

  • 287Mפרמטרים
  • 1.1 GBמשקל הקבצים
  • 58,149הורדות בחודש
  • 83לייקים

מה זה

המודל מתבסס על ארכיטקטורת BoundaryExtractor ועל המקודד mDeBERTa-v3-base. במקום לסרוק חלונות באורך קבוע כמו מודלי span מסורתיים, הוא מאתר נקודות התחלה וסיום באופן דליל, מה שמאפשר לחלץ ישויות בכל אורך שנכנס לחלון ההקשר.

הייחוד כאן הוא איחוד משימות תחת קריאה אחת. הוא מסוגל לחלץ ישויות, לתייג מאפיינים ברמת הישות, למצוא יחסים ביניהן ולסווג את הטקסט כולו. המודל תומך בחילוץ רשומות מובנות תוך שמירה על הקשר בין השדות, כך שאפשר לקבל מבנה נתונים שלם ישירות מהטקסט.

בניגוד לגרסאות האנגלית בסדרה, הגרסה הזו מאומנת על מגוון שפות. המפרט כולל ראשי סיווג, יחסים ורשומות פעילים מראש, אך כרטיס המודל לא מציג ציוני דיוק או השוואות מספריות מול מודלים אחרים.

מתאים ל

  • חילוץ ישויות ויחסים מורכבים

    הוא מזהה שחקנים, פעולות והקשרים ביניהם ברמת דיוק גבוהה, ומחזיר גרף יחסים מלא במקום רשימת שמות מבודדת.

  • המרת טקסט חופשי לטבלאות

    מצב הרשומות קושר בין ערכים כמו רוכש ופריט ישירות, מה שחוסך שלבי התאמה ידניים בקוד.

  • ניתוח רגשות לפי ישות ספציפית

    הוא מאפשר להצמיד סנטימנט לאדם מסוים בטקסט מבלי להשליך אותו על החברות שמוזכרות באותו משפט.

איפה זה נופל

במסמכים ארוכים העיבוד מתבצע בחלוקה למקטעים, וישויות או יחסים שנחתכים בין שני מקטעים פשוט ילכו לאיבוד. המודל שומר על קשר בין שתי ישויות רק אם שתיהן הופיעו באותו מקטע בדיוק. בנוסף, חילוץ יחסים רגיל לא אוכף סוגי ישויות, כך שעלולים להתקבל קשרים שגויים לוגית אלא אם מפעילים מנגנון אילוצים כבד יותר כמו JointIE. יש לבדוק היטב את איכות הזיהוי בעברית, שכן הביצועים בפועל תלויים בייצוג השפה במקודד הבסיס.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

המודל נשען על מקודד mDeBERTa-v3-base שתומך בשפות רבות, אך כרטיס המודל אינו מציג מדדי ביצועים ייעודיים לעברית. מומלץ להריץ בדיקה על דוגמאות מהדומיין שלכם לפני שילוב בתהליך ייצור.

האם אפשר להריץ אותו ישירות דרך ספריית GLiNER הישנה?

לא, המודל משתמש בארכיטקטורת גבולות חדשה ומחייב התקנה של ספריית gliner2 וטעינה באמצעות AutoExtractor בלבד.

איך המודל מתמודד עם טקסטים ארוכים מעבר לחלון המקסימלי?

הספרייה כוללת פונקציות ייעודיות לפירוק הטקסט למקטעים חופפים, אך יש לקחת בחשבון שקשרים בין ישויות שמופיעות במקטעים נפרדים לא יאותרו.

איך מריצים

כדי להריץ אותו מתקינים את החבילה gliner2[local] וטוענים אותו בעזרת מחלקת AutoExtractor. הקוד מחייב פייתון 3.10 ומעלה, וטעינה דרך מחלקות ישנות של GLiNER2 תיכשל כי הארכיטקטורה שונה לחלוטין מגרסאות קודמות.

המודל דורש כ־1.1 ג'יגה-בייט של מקום ומשקלי ה־FP16 שוקלים כ־594 מגה-בייט, כך שהוא רץ בקלות על מעבד רגיל, כרטיסי מסך צרכניים ואפילו על שבבי אפל דרך MPS. אם המערכת שלכם מעבדת אלפי קריאות קצרות בשנייה ולא רוצים לתחזק שרתים, אפשר לפנות לשירותי פריסה, אבל עבור רוב השימושים העיבוד המקומי מהיר, זול ופשוט בהרבה.

pip install -U huggingface_hub
hf download fastino/gliner2.5-multi-v1

הקבצים

8 קבצים במאגר, 1.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא ללא תשלום תמלוגים. אפשר לשלב אותו במוצרים פנימיים או מסחריים, לשנות את הקוד ולהפיץ אותו, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקוריות ומצרפים עותק שלו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗