GPT
B

bert-large-cased

קוד פתוח

google-bertapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

גרסת 24 שכבות של המודל הקלאסי לניתוח טקסט באנגלית, שמשמרת אותיות גדולות וקטנות. מתאימה למי שצריך לאמן מסווג ייעודי על טקסט שבו יש חשיבות לשמות פרטיים וקיצורים.

  • 335Mפרמטרים
  • 512טוקנים בהקשר
  • 6.3 GBמשקל הקבצים
  • 86,858הורדות בחודש

מה זה

המודל אומן על ויקיפדיה באנגלית ועל מאגר ספרים של 11,038 כותרים, במטרה לחזות מילים חסרות ולזהות רצף בין משפטים. בשונה ממודלים שמייצרים טקסט מילה אחרי מילה בכיוון אחד, הארכיטקטורה כאן קוראת את כל המשפט משני הכיוונים יחד ומייצרת ייצוג עמוק של ההקשר.

המשמעות של גרסת cased היא שהמודל מבדיל בין אותיות גדולות לקטנות, מה שקריטי באנגלית כשרוצים להבחין בין מונחים, שמות של חברות או קיצורים לבין מילים רגילות. במבחני ביצועים שמפורטים בכרטיס, לאחר אימון ייעודי, הוא הגיע לציון F1 של 91.5 במענה על שאלות במאגר SQuAD 1.1 ולדיוק של 86.09 במשימת Multi NLI.

מתאים ל

  • סיווג טקסטים באנגלית

    בסיס מעולה לאימון מסווג שמסתמך על אותיות גדולות לזיהוי ישויות ושמות.

  • השלמת מילים חסרות

    חיזוי מילה שהוסתרה בתוך משפט נתון תוך התחשבות בהקשר שלפניה ואחריה.

  • חילוץ וקטורים למשפטים

    הפקת ייצוגים מתמטיים מתוך 24 השכבות לשימוש במודלים פשוטים יותר.

איפה זה נופל

הוא לא מסוגל לייצר טקסט חופשי, תשובות ארוכות או שיחות, ומיועד רק למילוי מילים חסרות או לבסיס לאימון נוסף. חלון ההקשר מוגבל ל־512 טוקנים, כך שאי אפשר להזין לו מסמכים ארוכים בבת אחת בלי לחתוך אותם. בנוסף, המודל אומן על אנגלית בלבד ולא מבין עברית, והכרטיס מודה במפורש שקיימות בתוכו הטיות סטטיסטיות שמקורן בטקסטים שמהם הוא למד, אשר יעברו הלאה לכל מודל שתאמנו עליו.

שאלות
נפוצות

האם אפשר להשתמש בו לניתוח טקסטים בעברית?

לא. המודל אומן אך ורק על מאגרים באנגלית, והטוקנייזר שלו כולל אוצר מילים ייעודי לאנגלית בלבד. כל ניסיון להזין לו עברית יניב פירוק שגוי של האותיות ותוצאות חסרות משמעות.

האם המודל מוכן לעבודה ישירה במוצר או שצריך לאמן אותו?

הוא יודע בעיקר להשלים מילים מוסתרות בצורתו הגולמית. לשימושים מעשיים כמו סיווג, זיהוי כוונות או מענה על שאלות, חייבים לבצע עליו אימון נוסף עם דאטה ייעודי של המשימה שלכם.

איך מריצים

המשקל הכולל של הקבצים עומד על 6.3 גיגהבייט וכולל 335 מיליון פרמטרים, כך שאפשר להריץ אותו בלי בעיה על כרטיס מסך בודד בעל זיכרון סביר או אפילו על מעבד רגיל לעיבוד של כמויות קטנות. ההרצה נעשית ישירות דרך ספריית transformers בפייתון, עם תמיכה מלאה בטעינה לתוך PyTorch או TensorFlow.

אם אתם צריכים לחלץ ממנו ייצוגים או לבצע משימות סיווג מקומיות במוצר שלכם, אין טעם לשלם לספק ענן חיצוני לפי קריאות API. הוא מספיק קומפקטי כדי שתריצו ותאמנו אותו על תשתית מקומית שלכם בעלויות נמוכות.

from transformers import pipeline

pipe = pipeline("fill-mask", model="google-bert/bert-large-cased")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקולות והפצה בתוך מוצרים סגורים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי, לצד ציון שינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗