GPT
B

bert-large-uncased

קוד פתוח

google-bertapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • rust

גרסת 24 השכבות של גוגל מיועדת להבנת משפטים באנגלית ולהשלמת מילים חסרות. מורידים אותה בעיקר כבסיס מוכח לאימון מסווגים מותאמים אישית.

  • 336Mפרמטרים
  • 512טוקנים בהקשר
  • 7.7 GBמשקל הקבצים
  • 644,415הורדות בחודש

מה זה

גוגל אימנו את המודל הזה בצורה עצמאית על טקסט גולמי מתוך ויקיפדיה באנגלית ומאגר ספרים לא מפורסמים. המטרה שלו היתה לפתור שתי משימות: ניחוש של מילים שהוסתרו בתוך משפט וזיהוי האם שני משפטים עוקבים זה לזה. בגלל המבנה הזה, הוא סורק את הטקסט לשני הכיוונים בו זמנית ובונה ייצוג עמוק של המשמעות שלו, בניגוד למודלים שמייצרים מילים אחת אחרי השנייה.

בגרסה הזו יש 336 מיליון פרמטרים שמתפרסים על פני 24 שכבות. במבחני ביצועים שעברו כוונון ממוקד, הוא מציג דיוק של 86.05 במבחן Multi NLI, ובמדד SQuAD 1.1 הוא מגיע לציון F1 של 91.0 ולדיוק מדויק של 84.3. המספרים האלה מראים שברגע שמכוונים אותו למשימה מוגדרת כמו מענה לשאלות או הבנת הקשר בין משפטים, הוא מבין את הטקסט ברמה גבוהה מאוד.

מתאים ל

  • חילוץ מאפיינים לאימון

    מפיקים וקטורים של משפטים שלמים באנגלית כדי להזין אותם לתוך מודל סיווג ייעודי.

  • כוונון למענה על שאלות

    מאמנים אותו מחדש על מאגר שאלות ותשובות באנגלית לקבלת דיוק גבוה מתוך קטעי טקסט.

  • השלמת מילים בהקשר

    מנחשים טוקנים חסרים בתוך משפטים באנגלית בזכות הבנה דו כיוונית של הטקסט.

איפה זה נופל

הוא לא יודע לייצר טקסט חופשי, ואם אתם מחפשים משהו שכותב תשובות ארוכות תצטרכו ארכיטקטורה אחרת. הקלט שלו מוגבל ל־512 טוקנים, כך שאי אפשר להזין לו מסמכים ארוכים בבת אחת. בנוסף, המודל הזה מתעלם מאותיות גדולות וקטנות, כך שהוא לא מבדיל בין שמות פרטיים למילים רגילות. הכרטיס מדגיש שהמידע שבו הוא אומן מכיל הטיות, ולכן כל הטיה כזו תעבור ישירות לכל מודל שתאמנו על גביו. הוא גם אומן על אנגלית בלבד, ולכן הוא חסר תועלת לעיבוד טקסט בעברית.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה עם טקסט בעברית?

לא. הוא אומן אך ורק על מאגרים באנגלית כמו ויקיפדיה האנגלית וספרים באנגלית. הוא לא יזהה תווים ומילים בעברית בצורה שימושית.

האם אפשר להשתמש בו כמו צ'אטבוט או לכתיבת מאמרים?

לא, הוא מבוסס על חיזוי מילים מוסתרות ולא על חיזוי המילה הבאה. בשביל יצירת טקסט שוטף צריך מודלים כמו GPT.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון, בפייפליין של fill-mask או דרך המחלקות של PyTorch ו־TensorFlow כדי להוציא וקטורים. עם משקל של 7.7 ג'יגה בייט בזיכרון, אפשר להריץ עליו הסקת מסקנות על כרטיס מסך בודד או אפילו על מעבד חזק, אבל כוונון עדין ידרוש כרטיס מסך מודרני עם מספיק זיכרון.

אם אתם צריכים רק לבדוק רעיונות או לבצע סיווג נקודתי מדי פעם, שליחת קריאות לשירות ענן מנוהל תחסוך את כאב הראש של ניהול שרת והורדת קבצים כבדים. מריצים אותו לבד בעיקר כשבונים מודל ייעודי שחייב לעבוד בסביבה פנימית וסגורה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="google-bert/bert-large-uncased")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לאמן עליו מודלים פנימיים ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים והתנאים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗