GPT
B

bert-base-multilingual-cased

קוד פתוח

google-bertapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

מודל בסיס רב לשוני מבית גוגל שאומן על ויקיפדיה ב־104 שפות. הוא מיועד בעיקר למי שצריך לחלץ ייצוגי טקסט או לאמן מסווג למשימות סיווג ותיוג שאינן מוגבלות לאנגלית בלבד.

  • 179Mפרמטרים
  • 512טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 1,858,502הורדות בחודש

מה זה

הגרסה הזו של ברט עברה אימון מוקדם על הטקסטים הגולמיים של 104 הוויקיפדיות הגדולות בעולם, תוך רגישות מלאה לאותיות גדולות וקטנות. הרעיון המרכזי מאחוריו הוא שילוב של חיזוי מילים מוסתרות וחיזוי המשכיות בין משפטים, כך שהמודל לומד הקשר דו כיווני עמוק בכל שפה בנפרד וביניהן. עם אוצר מילים משותף של 110,000 מילים וטוקנים, הוא נותן נקודת פתיחה רחבה מאוד לפרויקטים שצריכים להתמודד עם שפות מרובות באותו פייפליין.

המודל כולל 12 שכבות וכמעט 179 מיליון פרמטרים, מה שהופך אותו לקל יחסית בסטנדרטים הנוכחיים אך יעיל למשימות הבנה. המטרה כאן אינה כתיבת טקסטים או שיחה חופשית, אלא שימוש במשקלים המאומנים כדי לחלץ וקטורים איכותיים של משפטים, או כבסיס שעליו מאמנים שכבת סיווג ייעודית למשימות קונקרטיות.

מתאים ל

  • סיווג טקסטים רב לשוני

    מתאים למיון מסמכים, פניות תמיכה או ניתוח רגש במערכות שקולטות עשרות שפות שונות.

  • זיהוי ישויות ושמות

    משמר אותיות גדולות וקטנות, ולכן מתאים במיוחד לתיוג טוקנים, שמות ומותגים בשפות לטיניות.

  • חילוץ וקטורים להשוואה

    משמש שכבת בסיס טובה לייצוג מספרי של משפטים קצרים לצורך חיפוש דמיון סמנטי.

איפה זה נופל

החיסרון המרכזי הוא שהוא לא מיועד למשימות יצירת טקסט. מי שמחפש מודל שמייצר תוכן, מסכם פסקאות ארוכות או עונה כצ'אט, יגלה שהארכיטקטורה הזו פשוט לא מתאימה, ובכרטיס המודל נכתב במפורש לפנות למודלים ממשפחת GPT למטרות כאלה. בנוסף, מגבלת האורך קשיחה ועומדת על 512 טוקנים לכל היותר. טקסטים ארוכים, מסמכים שלמים או חוזים ייחתכו, אלא אם מפרקים אותם מראש ומטפלים בהם בחלקים קטנים.

שאלות
נפוצות

האם המודל מתאים ליצירת טקסט חדש או צ'אט?

לא, המודל אומן על חיזוי מילים חסרות בתוך משפט סגור ולא על פליטת טקסט המשכי. לשימושים של שיחה או כתיבה יוצרת צריך לפנות למודלים גנרטיביים.

האם חובה להשתמש במעבד גרפי חזק כדי להריץ אותו?

ממש לא, מדובר במודל של כ־179 מיליון פרמטרים שרץ בלי בעיה על מעבדי מחשב רגילים. כרטיס גרפי נחוץ רק אם אתם מאמנים אותו מחדש על דאטה גדול או צריכים עיבוד בקצבים גבוהים במיוחד.

איך מריצים

עם גודל קבצים של כ־3 גיגה בייט ופחות מ־180 מיליון פרמטרים, המודל הזה רץ בקלות על כל מעבד מודרני, ולא מחייב כרטיס גרפי כבד כדי להריץ הסקת מסקנות מהירה. בשימוש עם ספריית טרנספורמרס ב־PyTorch או TensorFlow, הטעינה לזיכרון דורשת משאבים מינימליים בלבד.

בגלל המשקל הנמוך וזמני התגובה הקצרים, כמעט אין היגיון לשלם על קריאות לשירותי ענן חיצוניים כשמריצים משימות שוטפות. הקמה של שרת מקומי קטן מאפשרת עיבוד ישיר, שליטה מלאה בפרטיות הנתונים וחיסכון משמעותי בעלויות שוטפות.

from transformers import pipeline

pipe = pipeline("fill-mask", model="google-bert/bert-base-multilingual-cased")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון אפאצ'י 2.0, שמאפשר שימוש מסחרי חופשי, שינוי של המשקלים והפצה בתוך מוצרים פנימיים או מסחריים, ללא תשלום תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗