GPT
B

bert-base-greek-uncased-v1

קוד פתוח

nlpauebרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זהו עיבוד מבוסס BERT שמיועד כולו לעיבוד שפה טבעית ביוונית. אם אתם צריכים סיווג, זיהוי ישויות או הבנת טקסט ביוונית, הוא מספק נקודת זינוק חזקה בהרבה ממודלים רב-לשוניים כלליים.

  • 512טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 9,174הורדות בחודש
  • 39לייקים

מה זה

מדובר במודל שפה שנבנה לפי המתכון של bert-base של גוגל, עם 12 שכבות ו־110 מיליון פרמטרים, אבל אומן ספציפית על טקסטים ביוונית מויקיפדיה, פרוטוקולים של הפרלמנט האירופי ומאגר OSCAR. המטרה העיקרית שלו היא לשמש בסיס למשימות עיבוד במורד הזרם כמו מילוי מילים חסרות, ניתוח כוונות או זיהוי ישויות.

בבדיקות הביצועים שפורסמו בכרטיס המודל, הוא עוקף בעקביות חלופות רב-לשוניות מוכרות. במשימת זיהוי ישויות ביוונית הוא הגיע לציון מיקרו F1 של 85.7, מעל XLM-R שעמד על 84.8 ומעל mBERT שהשיג 82.1. במבחן היסק שפה טבעית XNLI ביוונית הוא השיג דיוק של 78.6 לעומת 77.3 של XLM-R, מה שמראה שהמיקוד בשפה בודדת נותן לו יתרון מוחשי על פני מודלים שמנסים לכסות עשרות שפות במקביל.

מתאים ל

  • זיהוי ישויות ביוונית

    שליפת שמות, מקומות וארגונים מתוך טקסטים, בזכות דיוק F1 של 85.7 שגובר על מודלים רב-לשוניים.

  • סיווג טקסט והיסק לוגי

    אימון נוסף למיון פניות לקוחות או ניתוח יחסים בין משפטים ביוונית עם דיוק מוכח של 78.6 במבחן XNLI.

  • מילוי מילים חסרות

    השלמת טוקנים מוסתרים בטקסט יווני כפי שהוא מוגדר במשימת הבסיס שלו.

איפה זה נופל

המודל הזה מטפל ביוונית בלבד, כך שטקסטים בעברית, אנגלית או שילוב שפות פשוט לא יעבדו איתו כראוי. בנוסף, חלון ההקשר שלו מוגבל ל־512 טוקנים, מה שהופך אותו ללא מתאים לקריאה או ניתוח של מסמכים ארוכים ברצף ללא חלוקה מוקדמת לפסקאות. הוא מוגדר סביב אותיות קטנות ללא טעמים, ולכן מידע שנסמך על אותיות גדולות או היגוי מדויק נמחק בעיבוד. חשוב לזכור גם שהוא לא מודל יוצר טקסט בסגנון שיחה, אלא כלי קידוד והבנה שמצריך אימון נוסף כדי לבצע משימה עסקית ספציפית.

שאלות
נפוצות

האם המודל יודע להתמודד עם אותיות גדולות וסימני הטעמה ביוונית?

הוא מתעלם מהם לחלוטין. הטוקנייזר ממיר כל טקסט לאותיות קטנות ומנקה את הטעמים ביוונית לפני שהוא מעביר את המידע לשכבות הפנימיות, כך שאם ההבדל בין אות גדולה לקטנה קריטי למשימה שלכם, תאבדו את המידע הזה.

למה לא להשתמש במודל רב-לשוני כמו mBERT במקומו?

מודלים רב-לשוניים חולקים את אוצר המילים והמשקלים שלהם עם עשרות שפות, מה שפוגע בייצוג של שפות ספציפיות. המבחנים בכרטיס המודל מראים בבירור שהוא משיג תוצאות טובות יותר מ־mBERT ו־XLM-R במשימות של הבנת יוונית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers ב־PyTorch או ב־TensorFlow באמצעות שתי שורות קוד של AutoTokenizer ו־AutoModel. הטוקנייזר המובנה כבר מטפל אוטומטית בהסרת סימני הטעמה יווניים ובהמרה לאותיות קטנות, כך שאין צורך לכתוב קוד ניקוי נפרד לפני ההזנה.

מבחינת חומרה, 110 מיליון פרמטרים ומשקל קבצים של 1.4 גיגה-בייט מאפשרים להריץ אותו בקלות על מעבד רגיל עבור היסק, או על כל כרטיס מסך בסיסי עם 4 עד 8 גיגה-בייט זיכרון כדי לאמן אותו על נתונים שלכם. הוא קל וזול מספיק לתחזוקה עצמית, כך שאין שום סיבה אמיתית לפנות ל־API חיצוני בתשלום אלא אם אתם רוצים להימנע מניהול שרתים לחלוטין.

from transformers import pipeline

pipe = pipeline("fill-mask", model="nlpaueb/bert-base-greek-uncased-v1")
print(pipe("שלום"))

הרישיון

היוצרים לא הגדירו ולא ציינו רישיון שימוש בעמוד המודל. המשמעות עבורכם היא סיכון משפטי ברור, אי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי, להפיץ אותו מחדש או להשתמש בו בארגון מבלי לפנות קודם לצוות המחקר באוניברסיטת אתונה ולקבל אישור מפורש בכתב.

הרישיון המלא בעמוד המודל ↗