GPT
B

bert-base-multilingual-uncased

קוד פתוח

google-bertapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

בסיס רב-לשוני קלאסי לחיזוי מילים מוסתרות ומיצוי מאפיינים. הוא נותן נקודת זינוק זולה ונוחה למי שרוצה לאמן סיווג טקסטים ביותר ממאה שפות במקביל.

  • 168Mפרמטרים
  • 512טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 4,073,287הורדות בחודש

מה זה

מדובר במודל של 168 מיליון פרמטרים עם 12 שכבות, שאומן ישירות על ויקיפדיה ב־102 השפות הגדולות ביותר. האימון הראשוני שלו התבסס על שתי משימות עצמאיות, השלמת טוקנים מוסתרים בטקסט וחיזוי האם שני מקטעים הופיעו ברצף. השילוב הזה נותן ייצוג דו-כיווני עמוק של כל משפט, בניגוד למודלים שקוראים רק מכיוון אחד.

הגרסה הזו היא uncased, כלומר כל הטקסט הומר לאותיות קטנות מראש והוא לא מבדיל בין אות גדולה לקטנה. אוצר המילים המשותף שלו כולל 110,000 טוקנים של WordPiece, כשהוא מאזן בין שפות נפוצות לפחות נפוצות באמצעות דגימת יתר וחסר. אם יש לכם צורך בסיווג טקסטים או מציאת ישויות במגוון שפות, הוא מספק וקטורים מוכנים בלי שתצטרכו להחזיק מודל נפרד לכל שפה.

מתאים ל

  • סיווג טקסט רב-לשוני

    מאפשר לאמן מסווג יחיד על גבי הייצוגים שלו עבור קלטים בעשרות שפות שונות.

  • חילוץ ישויות וטוקנים

    מתאים לזיהוי רכיבים במשפט בזכות הייצוג הדו-כיווני של כל טוקן ביחס להקשר.

  • השלמת מילים מוסתרות

    מבצע תחזית ישירה של מילים חסרות בתוך משפט קיים לפי ההקשר המלא.

איפה זה נופל

הוא לא מתאים בכלל ליצירת טקסט חופשי, כתיבה או שיחה. חלון ההקשר שלו מוגבל ל־512 טוקנים בסך הכול עבור שני המשפטים יחד, כך שטקסטים ארוכים ייחתכו. בנוסף, הכרטיס מזהיר במפורש מקיומן של הטיות בתחזיות שלו שנולדו מטקסט המקור של ויקיפדיה, וכל הטיות אלו יעברו בירושה גם לגרסאות שתאמנו עליו.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אטבוט או ליצירת תוכן?

לא. הארכיטקטורה שלו מיועדת להבנת טקסט, השלמת מילים מוסתרות ומיצוי ייצוגים. אם אתם מחפשים מודל שמייצר תשובות או טקסטים חדשים, תצטרכו להשתמש במודלים ייעודיים ליצירת טקסט כמו GPT2.

האם העובדה שהוא uncased פוגעת בזיהוי שמות?

כן, במשימות כמו זיהוי שמות עצם פרטיים באנגלית ושפות לטיניות, היעדר אותיות גדולות מקשה על המודל לזהות שמדובר בשם של אדם או חברה. במקרים שבהם גודל האות קריטי, עדיף לבחור גרסת cased.

איך מריצים

עם גודל קבצים של 2.8 גיגה-בייט וספריית transformers, הרצה של המודל הזה מתבצעת בקלות גם על מעבד רגיל ובלי צורך בכרטיס מסך ייעודי. טוענים אותו ישירות בפייתון עם PyTorch או TensorFlow, והוא צורך מעט מאוד זיכרון בהשוואה למודלים מודרניים.

עדיף להריץ אותו מקומית אם אתם מתכוונים לעשות לו התאמה אישית לדאטה ספציפי משלכם. אם אתם צריכים רק לחלץ מאפיינים מדי פעם ולא רוצים לנהל שרת או תלויות קוד, שירותי API מוכנים יחסכו את ההתעסקות בהתקנה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="google-bert/bert-base-multilingual-uncased")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקולות, ושילוב שלהם במוצרים סגורים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים הרלוונטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗