GPT
G

gliner_multi-v2.1

קוד פתוח

urchadeapache-2.02024-04-09

  • gliner
  • pytorch
  • safetensors
  • token-classification
  • multilingual

זיהוי ישויות בכל שפה בלי להגדיר קטגוריות מראש ובלי להרים מודל ענק. אתם מגדירים שמות של שדות חופשיים ומקבלים חילוץ מהיר וזול.

  • 289Mפרמטרים
  • 2.2 GBמשקל הקבצים
  • 22,351הורדות בחודש
  • 170לייקים

מה זה

במקום לאמן מודל ספציפי לכל סוג מידע או לשלם הון על פרומפטים למודלי שפה גדולים, המודל הזה מתבסס על ארכיטקטורת אנקודר דו-כיוונית דמויית BERT לחילוץ ישויות פתוח. הרעיון פשוט: מעבירים לו טקסט ומערך של תוויות שמעניינות אתכם, כמו שחקן, תאריך או פרס, והוא מחלץ את המופעים ישירות מתוך הטקסט.

בגרסה הזו, להבדיל מגרסאות האנגלית המקבילות בסדרה, הדגש הוא על תמיכה רב-לשונית. עם 289 מיליון פרמטרים ומשקל קבצים של כ־2.2 גיגה-בייט, הוא מספק אלטרנטיבה קומפקטית מאוד למשימות סיווג טוקנים שוטפות, בלי לדרוש שרתים מנופחים ובלי להינעל על ישויות סטנדרטיות כמו מיקום וארגון בלבד.

מתאים ל

  • חילוץ ישויות גמיש בטקסט רב-לשוני

    זיהוי שדות מותאמים אישית ללא אימון מחדש, בטקסטים שמכילים מגוון שפות במקביל.

  • אנונימיזציה מקומית של מסמכים

    איתור שמות, תאריכים וארגונים בסביבה סגורה ומאובטחת ללא הוצאת נתונים לרשת.

  • חלופה חסכונית ל־LLM בצינורות מידע

    עיבוד כמויות גדולות של מסמכים במהירות גבוהה ובשבריר מעלות ההרצה של מודל גנרטיבי.

איפה זה נופל

למרות ההבטחה לתמיכה רב-לשונית, הדף אינו מפרט אילו שפות נכללו באימון ובאיזה היקף. חובה לבדוק אותו ישירות על הדאטה שלכם, במיוחד בטקסטים מורכבים או בשפות עשירות מורפולוגית, לפני שסומכים עליו בזיהוי ישויות חריגות.

בנוסף, מדובר באנקודר לזיהוי טוקנים בלבד. הוא לא מסוגל לנמק את ההחלטות שלו, לחבר טקסט או לתקן שגיאות כתיב במקור.

אותה משפחה

gliner-multi יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מגדירים לו אילו ישויות לחפש בטקסט?

מעבירים רשימת מחרוזות חופשית לפונקציית החיזוי, למשל שמות של קבוצות ספורט, תאריכים או תארים. המודל ממפה את הטקסט ישירות מול התוויות שהגדרתם בקריאה הנוכחית.

האם הוא יכול לרוץ על מעבד רגיל בלי GPU ייעודי?

כן, המשקל הכולל עומד על כ־2.2 גיגה-בייט והוא מבוסס אנקודר קל של 289 מיליון פרמטרים. הרצה על CPU סבירה בהחלט לנפחי עבודה מתונים, אם כי כרטיס גרפי קטן יספק זמני תגובה עדיפים.

איך מריצים

מתקינים את ספריית gliner בפייתון וטוענים את המשקלים ישירות עם GLiNER.from_pretrained. אין פה צורך בתשתית מורכבת או בכרטיס מסך מפלצתי, כי קובץ של 2.2 גיגה-בייט רץ חלק על מעבד סטנדרטי או על GPU בסיסי וזול בהרבה ממה שדורש מודל שפה גנרטיבי.

אם אתם עובדים רק באנגלית, גרסאות ה־small או ה־large הייעודיות לאנגלית מאותה סדרה עשויות להתאים יותר. לעומת זאת, למערכות שקולטות טקסטים בשפות מעורבות וצריכות לרוץ מקומית בלי לשתף מידע עם ספקי ענן חיצוניים, הרצה מקומית שלו סוגרת את הפינה בעלויות מינימליות.

pip install -U huggingface_hub
hf download urchade/gliner_multi-v2.1

הקבצים

5 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי והפצה של המשקלים בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗