GPT
G

gliner-multitask-large-v0.5

קוד פתוח

knowledgatorapache-2.02024-05-30

  • gliner
  • pytorch
  • NER
  • information extraction
  • relation extraction

חילוץ ישויות, יחסים ותשובות מטקסט לפי הגדרות שאתם קובעים בזמן אמת, בלי אימון מחדש. הוא מבוסס על מקודד דמוי ברט ורץ מהר בהרבה ממודלי שפה גנרטיביים.

  • 3.3 GBמשקל הקבצים
  • 1,229הורדות בחודש
  • 141לייקים

מה זה

המודל פועל כמקודד טקסט דו כיווני שמחלץ מידע חופשי בלי צורך בהגדרת תוויות מראש בזמן האימון. במקום להריץ מודל שפה כבד שמייצר טקסט מחדש, אתם מעבירים לו קטע ומערך של תוויות מבוקשות, והוא מצביע ישירות על המקטעים הרלוונטיים. מעבר לזיהוי ישויות קלאסי, הכרטיס מציג שימושים כמו זיהוי יחסים בין גורמים, שליפת משפטי סיכום, מענה על שאלות וחילוץ סנטימנט.

בבדיקות מול מודלים ייעודיים לזיהוי ישויות ללא אימון מוקדם, הוא השיג ממוצע מדד דיוק של 0.6276 על פני שבעה מאגרי נתונים שונים. התוצאה הזו עוקפת את מודל הבסיס של אותה משפחה שעומד על 0.5754, ומתעלה מעט על מודלים מתחרים. היתרון שלו בולט בעיקר בטקסטים פוליטיים ומוזיקליים, אך הוא עדיין מוגבל לתחומים שהוזנו לו.

מתאים ל

  • חילוץ ישויות גמיש

    שליפת שמות, תפקידים ותאריכים מתוך מסמכים באנגלית לפי תוויות משתנות בלי לאמן מודל ייעודי.

  • מיפוי קשרים בטקסט

    זיהוי יחסים בין גופים שונים בתוך פסקאות, כמו שיוך מייסדים לחברות ותאריכי הקמה.

  • תשובות מתוך מקטע

    איתור קטעי טקסט שמכילים מענה ישיר לשאלה מוגדרת ללא עלויות יצירת טקסט של מודל גנרטיבי.

איפה זה נופל

המודל תומך רשמית באנגלית בלבד. אם תזינו לו עברית, תקבלו תוצאות חלקיות מאוד או ג'יבריש. בבדיקות הביצועים שלו הוא נחלש משמעותית בתחומים כמו עולם המסעדות, שם הגיע לציון של 0.4351 בלבד, ובתחום הבינה המלאכותית עם 0.5105. שיטות כמו מענה על שאלות או סיכום מבוססות על שרשור טקסט לשאילתה וחילוץ מקטעים קיימים בלבד, ללא יכולת לנסח תשובה שלא מופיעה מפורשות במסמך.

שאלות
נפוצות

האם הוא עובד על טקסט בעברית?

לא. המודל אומן והוגדר רשמית עבור אנגלית בלבד. ניתוח של עברית יניב תוצאות פגומות ולא מדויקות.

מה צריך להתקין כדי להפעיל אותו בקוד?

צריך להתקין את ספריית gliner דרך מנהל החבילות בפייתון, לטעון את המשקולות ישירות, ולהזין את הטקסט יחד עם רשימת התוויות המבוקשת.

האם הוא מייצר תשובות חדשות לשאלות?

לא, הוא אינו מודל גנרטיבי. המודל רק מסמן ומחלץ מתוך הטקסט הקיים את המילים שעונות לשאלה שהוגדרה בתווית.

איך מריצים

ההרצה נעשית דרך ספריית פייתון ייעודית בשם gliner. הקבצים שוקלים 3.3 ג'יגה בייט, כך שכל כרטיס מסך מודרני עם שמונה ג'יגה זיכרון מריץ אותו בקלות, ואפשר להריץ אותו גם על מעבד רגיל בשרת בלי חומרה גרפית ייעודית.

אם אתם צריכים רק חילוץ ישויות קבוע מתוך ערימות של מסמכים, להחזיק שרת עצמאי למודל הזה זול ומהיר בהרבה מפנייה למודל גנרטיבי חיצוני בתשלום לפי טוקנים.

pip install -U huggingface_hub
hf download knowledgator/gliner-multitask-large-v0.5

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים פנימיים או חיצוניים ולשנות את הקוד כרצונכם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗