GPT
B

bert-base-turkish-cased

קוד פתוח

dbmdzmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

זהו מודל BERT שאומן ייעודית לשפה הטורקית תוך שמירה על אותיות גדולות וקטנות. הוא מיועד למי שצריך מודל בסיס קל לעיבוד שפה בטורקית בלי לסחוב מודל רב לשוני כבד.

  • 111Mפרמטרים
  • 512טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 72,658הורדות בחודש

מה זה

מדובר במודל שמכונה BERTurk, שנוצר על ידי צוות הספרייה הדיגיטלית בבוואריה בשיתוף קהילת ה־NLP הטורקית. הוא אומן על קורפוס טורקי מסונן בהיקף של 35 גיגה בייט ומעל ארבעה מיליארד טוקנים, שנאספו ממקורות כמו ויקיפדיה, OSCAR ומאגרים ייעודיים. הוא כולל 12 שכבות וסך הכל 111 מיליון פרמטרים, בדיוק במבנה הסטנדרטי של ארכיטקטורת BERT בסיסית.

ההבדל המשמעותי לעומת שימוש במודל רב לשוני הוא המיקוד. המילון וחלוקת הטוקנים מותאמים לגמרי למורפולוגיה של הטורקית, והעובדה שהוא cased שומרת על אותיות גדולות, מה שעוזר במיוחד בזיהוי שמות וישויות. היוצרים מפנים למאגר חיצוני עבור תוצאות ספציפיות במשימות כמו חלקי דיבר או זיהוי ישויות, כך שאין ציוני דיוק מפורטים ישירות בכרטיס המודל.

מתאים ל

  • זיהוי ישויות בטורקית

    השמירה על אותיות גדולות וקטנות מסייעת לזהות שמות של אנשים ומקומות בטקסט טורקי.

  • סיווג טקסטים קצרים

    הגודל הקל וחלון הטוקנים מתאימים למיון ביקורות, כותרות או הודעות תמיכה בטורקית.

  • ניתוח חלקי דיבר

    אימון המודל על מיליארדי טוקנים מקומיים מאפשר לפרק מבנים תחביריים מורכבים בשפה.

איפה זה נופל

ההגבלה הקשה ביותר היא חלון ההקשר, שעומד על 512 טוקנים בלבד. אם תרצו לנתח מסמכים ארוכים או חוזים בטורקית, תצטרכו לחתוך את הטקסט או לעבוד בחלונות חופפים. המודל מתמחה בטורקית בלבד ולא יתאים לטקסטים מעורבים עם עברית או שפות אחרות מעבר לאנגלית בסיסית. בנוסף, הכרטיס לא מספק מדדי ביצועים ישירים מובנים, ולכן חובה להריץ הערכה על הנתונים שלכם לפני שמעלים אותו למוצר.

שאלות
נפוצות

האם המודל מתאים לעיבוד טקסטים ארוכים?

לא באופן ישיר. חלון ההקשר מוגבל ל־512 טוקנים, ולכן טקסטים ארוכים ייחתכו אלא אם תיישמו פיצול ידני לקטעים קטנים.

האם אפשר להריץ אותו על מחשב בלי כרטיס מסך ייעודי?

כן. מודל של 111 מיליון פרמטרים רץ היטב גם על מעבד מרכזי רגיל, אם כי להסקה מהירה בסביבת ייצור עדיף כרטיס מסך בסיסי.

איך מריצים

המשקל הכולל של הקבצים עומד על שלושה גיגה בייט, והוא נתמך ישירות בספריית transformers באמצעות PyTorch. עם 111 מיליון פרמטרים, כמעט כל כרטיס מסך ביתי מודרני או אפילו מעבד סביר יריצו אותו בלי מאמץ מיוחד להסקה.

אם יש לכם שרת עצמאי פשוט, אין סיבה לשלם על API חיצוני כדי להריץ גודל כזה. שירות חיצוני שווה רק אם אתם לא רוצים לתחזק תשתית בכלל, או אם הדרישה היא טיפול במנות גדולות במיוחד בזמן אמת. כרגע המשקלים זמינים ישירות רק ל־PyTorch, ומי שצריך תמיכה ב־TensorFlow יצטרך לבקש זאת מהמפתחים.

from transformers import pipeline

pipe = pipeline("text-generation", model="dbmdz/bert-base-turkish-cased")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, ושילוב במוצרים סגורים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית והרישיון בתוך העותקים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗