GPT
M

mrebel-large

קוד פתוח

Babelscapecc-by-nc-sa-4.02023-06-12

  • transformers
  • pytorch
  • safetensors
  • mbart
  • text2text-generation

מחלץ יחסים וישויות מטקסט בשמונה שפות ישירות למבנה של גרף ידע. פתרון ממוקד למי שצריך לחלץ עובדות מורכבות בלי לבנות סוללת מודלים נפרדת לכל שלב.

  • 611Mפרמטרים
  • 1,024טוקנים בהקשר
  • 4.6 GBמשקל הקבצים
  • 2,774הורדות בחודש

מה זה

מדובר בגרסה רב לשונית של מודל REBEL, שמבוססת על ארכיטקטורת mBART עם 611 מיליון פרמטרים. המודל ממיר את המשימה של חילוץ יחסים לבעיית יצירת טקסט מקצה לקצה. במקום לזהות קודם ישויות ואז לנסות לסווג את הקשרים ביניהן בעזרת כמה כלים שונים, אתם מזינים טקסט ומקבלים ישירות שלשות של נושא, יחס ומושא שמסומנות באמצעות טוקנים מיוחדים.

הוא אומן על מאגר נתונים ייעודי בשם RED FM, ותומך בשפות כמו אנגלית, ערבית, גרמנית, צרפתית, ספרדית, הינדי, יוונית וקטלאנית. אם אתם מחפשים כלי שיודע לקרוא מסמך באחת השפות האלה ולפלוט עובדות מובנות לעבודה עם גרפי ידע, זה כיוון יעיל בהרבה ממודלים כלליים שסתם מנחשים את המבנה.

מתאים ל

  • בניית גרפי ידע

    חילוץ אוטומטי של שלשות מובנות מתוך מאמרי חדשות או מסמכים באנגלית ובשפות אירופיות.

  • אימון ייעודי לחילוץ מידע

    נקודת פתיחה טובה לכוונון על דאטה פנימי של ארגון שזקוק למיפוי קשרים מורכבים בין ישויות.

  • חיבור ישויות בארגונים

    הפיכת טקסט חופשי במספר שפות לקשרים ישירים לתוך בסיסי נתונים מבוססי גרף.

איפה זה נופל

הבעיה הבולטת ביותר עבורנו היא היעדר עברית ברשימת השפות הנתמכות, כך שלטקסטים מקומיים הוא פשוט לא יעזור בלי אימון ייעודי מחדש. בנוסף, חלון ההקשר עומד על 1,024 טוקנים בלבד. אי אפשר לזרוק אליו ספר או חוזה ארוך בבת אחת, וחייבים לחתוך את הטקסט לפסקאות מראש. הוא גם פולט טוקנים ייעודיים שמחייבים אתכם לכתוב שכבת עיבוד נוספת כדי להגיע לנתונים שימושיים בבסיס הנתונים שלכם.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן על שמונה שפות בלבד, ביניהן אנגלית, ערבית וגרמנית, ועברית אינה חלק מהן. הרצה שלו על טקסט עברי תייצר ככל הנראה הזיות או פלט שבור לחלוטין.

למה הפלט מגיע עם תגיות מוזרות בטקסט?

הארכיטקטורה מייצרת טקסט שמכיל טוקנים ייעודיים שמפרידים בין הנושא, המושא וסוג הקשר ביניהם. צריך לכתוב פונקציית פענוח פשוטה בקוד כדי לחתוך את המחרוזת לשלשות ברורות.

איך מריצים

כדי להריץ אותו צריך בסך הכול את ספריית transformers הרגילה של פייתון. קבצי המודל שוקלים 4.6 גיגה בייט בדיוק של float32, כך שכרטיס מסך בסיסי עם 8 או 12 גיגה זיכרון יחזיק אותו בקלות רבה להסקה, ואפשר להריץ אותו אפילו על מעבד סביר אם לא בונים על זמני תגובה של אלפיות שניה. מי שרוצה לחסוך זיכרון יכול לטעון אותו בחצי דיוק.

הממשק המובנה בעמוד של הדגם באתר Hugging Face לא מציג את הטוקנים המיוחדים שנחוצים כדי להפריד בין הישויות והיחסים, לכן אל תנסו לבדוק אותו שם. תצטרכו להוריד אותו לקוד מקומי או לפתוח את ההדגמה ב־Spaces, ולכתוב קוד קצר שמפענח את המחרוזת ומפרק אותה לשלשות נקיות.

from transformers import pipeline

pipe = pipeline("translation", model="Babelscape/mrebel-large")
print(pipe("שלום"))

הרישיון

המטא דאטה מציין רישיון cc-by-nc-sa-4.0 שמגביל שימוש לא מסחרי בלבד, בעוד שבגוף הטקסט נכתב CC BY-SA 4.0 שכן מתיר מסחריות תחת שיתוף זהה. בגלל הסתירה הזו, חובה לברר את הנושא מול היוצרים לפני שילוב שלו במוצר מסחרי, מה גם שדרישת השיתוף הזהה מחייבת אתכם לשחרר נגזרות תחת אותו הרישיון.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗