GPT
G

gliner_large-v2.1

קוד פתוח

urchadeapache-2.02024-04-10

  • gliner
  • pytorch
  • token-classification
  • multilingual

חילוץ ישויות בלי רשימה סגורה מראש ובלי לשלם על כל קריאת פרומפט ל־LLM ענק. מקבלים טקסט ורשימת תוויות חופשית, והוא מוצא אותן במבנה קומפקטי.

  • 1.7 GBמשקל הקבצים
  • 6,671הורדות בחודש
  • 55לייקים

מה זה

במקום להיתקע עם מודלי NER ישנים שמכירים רק שמות, מקומות ותאריכים, או לשלוח טקסטים ארוכים למודלי שפה כבדים ששורפים כסף וזמן, המודל הזה מתבסס על אנקודר דו-כיווני דמוי BERT עם 459 מיליון פרמטרים. הרעיון פשוט: מגדירים לו בזמן ריצה אילו סוגי ישויות מחפשים, אפילו תוויות מוזרות כמו פרסים או תחרויות ספורט, והוא מסמן אותן בטקסט ישירות.

בגרסה הזו הוא מגיע בנפח של 1.7 גיגה-בייט, שזה הגודל המקסימלי במשפחת הדגמים הזו, מעל גרסאות ה־small וה־medium. הוא פותר את צוואר הבקבוק של אימון מחדש בכל פעם שהדאטה משתנה, בלי לסחוב ארכיטקטורה גנרטיבית שלמה שלא באמת צריך לצורך סיווג טוקנים.

מתאים ל

  • חילוץ ישויות מותאמות אישית

    זיהוי מושגים ייחודיים כמו שמות טורנירים או פרסים בלי לאמן מודל מאפס.

  • תיוג דאטה לצוותי פיתוח

    מעבר על כמויות טקסט באנגלית וסימון ישויות מהיר מקומית בלי עלויות API.

  • עיבוד מסמכים באנגלית

    שליפת שמות, תאריכים וארגונים מתוך חוזים ומסמכים במהירות ריצה גבוהה.

איפה זה נופל

בטבלת המודלים הרשמית, גרסת large-v2.1 מסומנת כדגם שמיועד לאנגלית בלבד, בניגוד לגרסת multi-v2.1. אם המערכת שלכם מעבדת עברית, אל תצפו שהוא יזהה ישויות מקומיות בצורה אמינה בלי בדיקה מחמירה מראש.

בנוסף, מדובר במודל אנקודר לסיווג ישויות בלבד. הוא לא מייצר טקסט, לא עונה על שאלות חופשיות ולא מחליף מנוע שיחה, אלא פשוט מחזיר מיקומים ותוויות בתוך המחרוזת המקורית.

אותה משפחה

gliner-large יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו לזיהוי ישויות בעברית?

הכרטיס מציין במפורש שהגרסה הזו מאומנת על אנגלית בלבד. אם יש לכם צורך בריבוי שפות או בעברית, עדיף לבדוק את urchade/gliner_multi-v2.1 ולא את גרסת ה־large הזו.

במה הוא שונה משימוש ב־GPT רגיל לחילוץ שמות?

מודל שפה גנרטיבי עולה כסף על כל טוקן, איטי בהרבה ודורש הנדסת פרומפטים כדי להחזיר מבנה אחיד. הדגם הזה שוקל 1.7 גיגה-בייט, רץ על שרת שלכם, ומחזיר ישירות את הטוקנים המסווגים בלי שטויות מסביב.

האם מותר למכור מוצר שמשתמש במודל הזה?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא. רק שימו לב שגרסאות v0 ו־v1 הישנות יותר היו תחת cc-by-nc-4.0 שאסר על כך, אבל מגרסה v2 ואילך המגבלה הזו הוסרה לחלוטין.

איך מריצים

כדי להריץ אותו מתקינים את ספריית gliner בפייתון, טוענים את המשקלים בפקודת from_pretrained ומפעילים את פונקציית predict_entities על הטקסט. עם משקל של 1.7 גיגה-בייט ו־459 מיליון פרמטרים, כל כרטיס מסך בסיסי עם 4 עד 8 גיגה זיכרון מריץ אותו בלי למצמץ, ואפשר לעבוד איתו גם על מעבד רגיל בביצועים סבירים.

אם התקציב או הזיכרון לחוצים אפשר לרדת לגרסאות ה־small או ה־medium שלהן יש פחות ממאתיים או מאתיים ועשרה מיליון פרמטרים. שווה לפנות ל־API חיצוני רק אם אין לכם שרת ייעודי או שאתם צריכים לטפל בטקסטים פעם ביום ולא רוצים לתחזק מכונה פעילה.

pip install -U huggingface_hub
hf download urchade/gliner_large-v2.1

הקבצים

4 קבצים במאגר, 1.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והפצה פנימית או מסחרית בתוך המוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗