GPT
B

bert-base-turkish-uncased

קוד פתוח

dbmdzmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זהו מודל BERT בסיסי וייעודי לטורקית באותיות קטנות. הוא מתאים למי שבונה משימות עיבוד שפה קלאסיות בטורקית ורוצה בסיס שאומן מראש על מאגר מקומי נרחב.

  • 512טוקנים בהקשר
  • 7.6 GBמשקל הקבצים
  • 208,100הורדות בחודש
  • 42לייקים

מה זה

מדובר במודל BERTurk עם 12 שכבות שמיועד כולו לשפה הטורקית. הצוות בגרמניה אימן אותו על שילוב של גרסה מסוננת של קורפוס OSCAR, מאגר מויקיפדיה, קובצי OPUS ומאגר ייעודי של כמאל אופלזר. כל החומר הזה הסתכם בנפח של 35GB ובסך הכל 44,04,976,662 טוקנים, כאשר האימון רץ על חומרת TPU ייעודית לאורך 2M צעדים.

המשמעות של גרסת uncased היא שהמודל אינו מבדיל בין אותיות גדולות לקטנות. הוא מיועד לייצוג טקסט, חילוץ מאפיינים וסיווג. במקום להסתמך על מודל רב לשוני כללי שדוחס עשרות שפות לאותו וקטור, כאן כל אוצר המילים והמשקולות מוקדשים לתחביר ולמורפולוגיה הטורקית.

מתאים ל

  • סיווג טקסט בטורקית

    זיהוי כוונות או ניתוח רגש בטקסטים קצרים בטורקית תוך ניצול אוצר מילים מקומי.

  • תיוג חלקי דיבר

    ניתוח מורפולוגי ותחבירי של משפטים בשפה הטורקית בעזרת ייצוגי וקטור מדויקים.

  • זיהוי ישויות שאינו תלוי רישיות

    חילוץ ישויות מתוך טקסטים שבהם האותיות הקטנות והגדולות נכתבו ללא הקפדה.

איפה זה נופל

ההגבלה הראשונה והברורה היא הגודל של חלון ההקשר, שעומד על 512 טוקנים בלבד. אי אפשר להזין לתוכו מסמכים ארוכים בבת אחת בלי לחתוך או לפצל אותם מראש. שנית, העובדה שהוא uncased פוגעת בזיהוי שמות עצם פרטיים שמתחילים באות גדולה, ולכן במשימות של זיהוי ישויות ייתכן שתעדיפו גרסה שמשמרת אותיות גדולות. בנוסף, המודל אינו מייצר טקסט חופשי אלא רק מייצג אותו.

שאלות
נפוצות

האם המודל יודע לעבוד עם עברית או אנגלית?

לא, המודל הזה אומן נטו על טקסטים בטורקית. הוא לא יזהה עברית ולא מיועד למשימות באנגלית.

האם אפשר להשתמש בו ב־TensorFlow ישר מהקופסה?

לא באופן ישיר. המפתחים פרסמו משקולות שמתאימות ל־PyTorch בלבד, וממליצים לפתוח issue אם נדרשת תמיכה ב־TensorFlow.

איך מריצים

טוענים את המשקולות ישירות דרך ספריית transformers מגרסה 2.3 ומעלה באמצעות AutoTokenizer ו־AutoModel. המשקולות שמורות בפורמט PyTorch בלבד, כך שאם אתם עובדים בסביבת TensorFlow תצטרכו להמיר אותן לבד או לפתוח קריאה למפתחים.

מבחינת חומרה, מודל של 12 שכבות רץ בקלות על מעבד גרפי סטנדרטי ואפילו על מעבד רגיל עבור עיבוד קל, אם כי סך כל הקבצים שוקל 7.6 GB. אם אין לכם תשתית שרתים מקומית פנויה, אפשר לשקול שירות ענן חיצוני, אבל המודל קל מספיק לתחזוקה עצמאית ללא עלויות כבדות.

from transformers import pipeline

pipe = pipeline("text-generation", model="dbmdz/bert-base-turkish-uncased")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, וזה אומר חופש פעולה כמעט מלא. מותר להשתמש בו לפרויקטים מסחריים, לשנות אותו, לאמן עליו הלאה ולהפיץ אותו בתוך מוצר סגור, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗