GPT
R

rebel-large

קוד פתוח

Babelscapecc-by-nc-sa-4.02022-03-02

  • transformers
  • pytorch
  • safetensors
  • bart
  • text2text-generation

חילוץ קשרים וישויות מטקסט גולמי הופך למשימת טקסט אל טקסט פשוטה. הוא מייצר שלשות של נושא, יחס ומושא בלי שרשרת צינורות מורכבת שצוברת שגיאות בדרך.

  • 406Mפרמטרים
  • 1,024טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 13,415הורדות בחודש

מה זה

במקום להפעיל מודל אחד לזיהוי ישויות ומודל נפרד לסיווג היחסים ביניהן, המודל הזה מתבסס על ארכיטקטורת BART ומייצר את השלשות ישירות כרצף טקסט. הוא הוכשר לזהות מעל 200 סוגי יחסים שונים מקלט באנגלית, וממיר משפטים שלמים למבנה נתונים מוגדר בריצה אחת.

הגישה הזו פותרת את הבעיה הקלאסית של צינורות עיבוד ישנים, שבהם טעות בזיהוי הישות הראשונית הפילה את כל הניתוח בהמשך. במבחנים על מאגרי מידע מוכרים כמו NYT, CoNLL04 ו־ADE הוא הגיע לתוצאות מובילות, מה שאומר שהוא מספיק יציב כדי להתמודד גם עם טקסטים רפואיים מורכבים וגם עם שפה חדשותית סטנדרטית.

מתאים ל

  • בניית גרפי ידע

    חילוץ אוטומטי של שלשות נושא, יחס ומושא מתוך מאמרים באנגלית לצורך הזנת בסיס נתונים מקושר.

  • אימות עובדות בטקסט

    פירוק טענות מורכבות בעיתונות או ברשת לקשרים מוגדרים ובדיקתם מול מאגרי עובדות קיימים.

  • מיצוי מידע רפואי

    זיהוי השפעות ותגובות בין תרופות למחלות מתוך מאגרי טקסט ייעודיים כמו ADE.

איפה זה נופל

הקלט מוגבל לאלף עשרים וארבעה טוקנים בלבד, כך שאי אפשר לזרוק אליו מסמך ארוך ומלא בלי לחתוך אותו לפסקאות מראש. הוא מאומן על אנגלית בלבד ולא יזהה שום דבר בעברית, כאשר למשימות רב לשוניות המפתחים מפנים לגרסה נפרדת בשם mREBEL. בנוסף, חילוץ הקשרים מוגבל למאתיים היחסים שהוא מכיר, ואם יש לכם צורך ביחס ספציפי לתחום צר שלא קיים באימון המקורי, תצטרכו לאמן אותו מחדש.

שאלות
נפוצות

האם אפשר להשתמש בו כדי לחלץ נתונים בעברית?

לא, המודל אומן על טקסטים באנגלית בלבד. אם תזינו לו עברית תקבלו פלט שבור, ולמשימות בשפות אחרות המפתחים יצרו גרסה נפרדת בשם mREBEL.

האם אני יכול להטמיע אותו במוצר של החברה שלי?

לא ישירות במוצר מסחרי, בגלל סעיף ה־NC ברישיון שאוסר שימוש מסחרי מכל סוג. הוא מתאים רק למחקר, אקדמיה או בדיקות היתכנות פנימיות.

איך מריצים

עם 406 מיליון פרמטרים ומשקל קבצים של שלושה גיגהבייט, אפשר להריץ אותו בקלות על מעבד גרפי צרכני צנוע או אפילו ישירות על מעבד רגיל של שרת מקומי. הטעינה מתבצעת ישירות דרך ספריית transformers הרגילה של פייתון בלי צורך בהגדרות תשתית מסובכות.

הוא מספיק קטן ומהיר כדי שלא יהיה שום צורך כלכלי להסתמך על שירות ענן חיצוני, במיוחד אם אתם צריכים לנתח כמויות גדולות של מסמכים ברצף. רק שימו לב שבווידג'ט הבדיקה הפשוט בדפדפן חסרים הטוקנים המיוחדים שמפרידים בין חלקי השלשה, אז לצורך עבודה אמיתית חייבים להריץ אותו בקוד עם הטוקנייזר המקורי שלו.

from transformers import pipeline

pipe = pipeline("text-generation", model="Babelscape/rebel-large")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-sa-4.0, מה שאומר שאסור להשתמש במודל הזה לכל מטרה מסחרית. אם אתם בונים מוצר למכירה או שירות שגובה כסף, המודל הזה חסום עבורכם לחלוטין. הוא מתאים למחקר, ניסויים פנימיים או פרויקטים ללא כוונת רווח, וכל שינוי או שיתוף שלו מחייב הפצה תחת אותם תנאים בדיוק.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗