GPT
G

gliner_base

קוד פתוח

urchadecc-by-nc-4.02024-02-16

  • gliner
  • pytorch
  • token-classification
  • en

זיהוי ישויות בכל קטגוריה שתרצו בלי לאמן מודל מחדש ובלי לשלם על קריאות למודל שפה ענק. הוא שוקל פחות מגיגהבייט ורץ מקומית בלי כאב ראש.

  • 755 MBמשקל הקבצים
  • 3,266הורדות בחודש
  • 86לייקים

מה זה

המודל הזה תופס משבצת מוגדרת מאוד בתחום זיהוי הישויות. בדרך כלל, מודלי זיהוי ישויות קלאסיים מוגבלים לחופן קטגוריות קשיחות שהוגדרו מראש, כמו שמות אנשים או מיקומים. אם רציתם לחלץ סוגי ישויות אחרים, נאלצתם לאמן מודל מאפס או לשלוח פרומפטים יקרים למודל שפה גנרטיבי ענק. המודל הנוכחי פותר את הבעיה הזו באמצעות ארכיטקטורת קידוד דו כיוונית דמוית ברט, שמאפשרת להגדיר ישויות חופשיות לגמרי בזמן אמת, בלי שום אימון נוסף.

עם 209 מיליון פרמטרים בלבד, הוא מציע פתרון קל משקל שחוסך את הצורך בתשתיות כבדות. אתם פשוט מעבירים לו את הטקסט ואת רשימת הישויות שמעניינות אתכם, והוא מאתר אותן ישירות מתוך התוכן באנגלית.

מתאים ל

  • חילוץ ישויות מותאמות

    שליפת פרסים, תחרויות ותאריכים מטקסטים באנגלית בלי צורך לאמן מודל ייעודי.

  • קריאת מסמכים על המעבד

    עיבוד מהיר של טקסטים באנגלית על חומרה זולה וללא צורך במעבדים גרפיים חזקים.

  • מחקר וניסויי שפה

    בדיקת היתכנות של זיהוי ישויות פתוח על קורפוסים באנגלית במסגרת אקדמית.

איפה זה נופל

החיסרון המרכזי כאן הוא השפה. המודל אומן על אנגלית בלבד ולא יודע לעבוד עם עברית, כך שאם הדאטה שלכם מקומי תצטרכו לחפש גרסה רב לשונית. בנוסף, מדובר בגרסת הבסיס הראשונה שיצאה בפברואר 2024, ולפני שרצים להטמיע אותה כדאי לבדוק את הגרסאות המאוחרות יותר של הפרויקט, שעברו שיפורים. מעבר לזה, הרישיון כאן מגביל מאוד וכדאי לחשוב פעמיים לפני שמשלבים אותו במערכת ארגונית.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא, המודל הזה אומן על אנגלית בלבד. אם אתם עובדים עם עברית או שפות אחרות, תצטרכו לפנות לגרסה הרב לשונית של הפרויקט.

האם מותר להטמיע אותו במוצר של החברה שלי?

לא, הרישיון אוסר על שימוש מסחרי מכל סוג. לשימוש מסחרי עדיף לבחור בגרסאות המאוחרות יותר של אותו מפתח, שמשוחררות תחת רישיון אפאצ'י.

האם צריך כרטיס מסך חזק בשביל להריץ אותו?

ממש לא, המודל שוקל 755 מגהבייט בלבד עם 209 מיליון פרמטרים. הוא רץ היטב על מעבד רגיל של מחשב נייד או שרת פשוט.

איך מריצים

כדי להריץ אותו מתקינים את ספריית gliner בפייתון, טוענים את המשקלים בפקודה אחת ושולחים טקסט לפונקציית החילוץ. עם משקל קבצים של 755 מגהבייט ו־209 מיליון פרמטרים, כל מעבד סביר מריץ אותו בלי להזיע, וכרטיס מסך בסיסי לחלוטין יספק ביצועים מהירים מאוד.

שימו לב שמדובר בגרסת הבסיס הראשונית מסדרה אפס. יש למפתח גרסאות מתקדמות יותר כמו סדרה אחת ושתיים, שמציעות גם גדלים של 166 מיליון או 459 מיליון פרמטרים. אם אתם צריכים זיהוי מהיר ומקומי באנגלית, אין שום סיבה לשלם לספקי ענן על כל קריאה.

pip install -U huggingface_hub
hf download urchade/gliner_base

הקבצים

4 קבצים במאגר, 755 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא סי סי בי וואי אן סי ארבע נקודה אפס, וזה אומר באופן חד משמעי שאסור להשתמש במודל הזה לשום מטרה מסחרית. הוא מיועד למחקר, ניסויים ופרויקטים אישיים בלבד. אם אתם בונים מוצר שמייצר הכנסה, תצטרכו להסתכל על הגרסאות המאוחרות יותר של הפרויקט, כמו סדרה שתיים, שפורסמו תחת רישיון אפאצ'י שמאפשר שימוש מסחרי חופשי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗