GPT
B

bert-base-cased

קוד פתוח

google-bertapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

מודל אנגלי דו-כיווני ותיק ששומר על אותיות גדולות וקטנות. מתאים לחילוץ ייצוגים וסיווג טקסטים קצרים כשדיוק בשמות וראשי תיבות קריטי לפרויקט.

  • 109Mפרמטרים
  • 512טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 3,646,179הורדות בחודש

מה זה

הארכיטקטורה כאן כוללת 12 שכבות ו־109 מיליון פרמטרים, כשהאימון המקורי התבצע על טקסטים מויקיפדיה האנגלית ומאגר ספרים לא מפורסמים. בשונה ממודלים שמתעלמים מרישיות, הגרסה הזו מבדילה בין מילים כמו english לבין English, מה שעוזר במשימות שבהן שמות עצם פרטיים או קיצורים משנים את המשמעות.

המטרה העיקרית היא לא שיחה או הפקת טקסט חופשי, אלא פענוח דו-כיווני לצורכי סיווג, זיהוי ישויות או מענה על שאלות. במבחני GLUE המודל הציג ממוצע של 79.6 אחרי כוונון, עם ציונים חזקים במיוחד של 93.5 בניתוח סנטימנט ב־SST-2 ו־90.5 ב־QNLI, לצד חולשה ברורה במשימות בלשניות מורכבות כמו CoLA שבה קיבל 52.1 בלבד.

מתאים ל

  • סיווג ישויות ושמות באנגלית

    ההבחנה בין אותיות גדולות לקטנות מאפשרת לזהות שמות של חברות, מותגים וראשי תיבות בצורה מדויקת.

  • ניתוח סנטימנט בטקסט קצר

    משיג תוצאה של 93.5 במבחן SST-2, מה שהופך אותו לבסיס מעולה לסיווג ביקורות ומשובים.

  • השלמת מילים מוסתרות במשפט

    הארכיטקטורה המקורית נועדה לחיזוי של טוקנים שהוסתרו, לצורך השוואת ביטויים או בדיקות שפה.

איפה זה נופל

המודל מוגבל לחלון של 512 טוקנים, ולכן הוא לא מתאים למסמכים ארוכים או חוזים בלי חיתוך מוקדם. כרטיס המודל מציין מפורשות שהוא מפתח הטיות מובנות מנתוני האימון, וההטיות האלה עוברות ישירות לכל גרסה מכווננת שתבנו עליו. בנוסף, הוא אומן רק על אנגלית, כך שאין מה לנסות להריץ עליו עברית, והוא לא מסוגל לייצר טקסט חופשי או תשובות ארוכות.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית?

לא. נתוני האימון כללו רק אנגלית, והוא לא מכיל אוצר מילים או הבנה של תחביר עברי. בשביל עברית צריך מודלים רב-לשוניים או מודל שאומן ישירות על נתונים מקומיים.

למה לבחור בו ולא בגרסה ללא רישיות?

הגרסה הזו קריטית אם הטקסט שלכם כולל שמות עצם, קיצורים טכניים או מותגים שבהם אות גדולה משנה את ההקשר של המילה. אם הטקסט שלכם מבולגן ונכתב כולו באותיות קטנות ללא הקפדה, דווקא הגרסה הרגילה תתאים יותר.

איך מריצים

במשקל כולל של 1.7 גיגה-בייט ועם 109 מיליון פרמטרים, אפשר להריץ אותו ישירות דרך ספריית transformers ב־PyTorch או ב־TensorFlow בלי מאמץ מיוחד. כל מעבד מודרני ממוצע מריץ משימות הסקה בגודל הזה במהירות סבירה לחלוטין, ואם מכווננים אותו, כל כרטיס מסך בסיסי עם מעט זיכרון ייעודי יספיק לעבודה.

אין שום היגיון לשלם על שירותי ענן חיצוניים או API בתשלום בשביל להריץ מודל במשקל כזה. אם השרת שלכם כבר באוויר, תארחו אותו בעצמכם ותחסכו זמני השהייה ברשת.

from transformers import pipeline

pipe = pipeline("fill-mask", model="google-bert/bert-base-cased")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של המשקולות ושילוב מלא במוצרים סגורים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה של המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗