GPT
B

bert_uncased_L-2_H-128_A-2

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • jax
  • safetensors
  • bert

גרסה ממוזערת של ברט שמיועדת להסקה מהירה במיוחד על מעבדים חלשים. בוחרים בה כשצריך מודל שפה קומפקטי ומוכנים להקריב דיוק תמורת מהירות ומשקל נוצה.

  • 4Mפרמטרים
  • 512טוקנים בהקשר
  • 50.8 MBמשקל הקבצים
  • 311,891הורדות בחודש

מה זה

גוגל שחררה את המודל הזה כחלק מסדרה של 24 ארכיטקטורות מוקטנות, והוא מוכר גם בשם BERT-Tiny. מדובר במודל שמכיל שתי שכבות בלבד וממד נסתר של 128, מה שהופך אותו לאחת האפשרויות הקטנות ביותר שאפשר למצוא ממשפחת הטרנספורמרים. הוא מיועד בעיקר למיצוי ידע, תהליך שבו מודל ענק מאמן אותו כדי להעביר אליו את היכולות שלו.

במבחני GLUE המודל הגיע לציון כולל של 64.2. במספרים האלה רואים בדיוק איפה הפשרות. במשימת סיווג סנטימנט כמו SST-2 הוא עומד על 83.2, שזה סביר למשימות קלות. מצד שני, במשימות בלשניות מורכבות כמו CoLA הוא קיבל ציון 0.0 עגול. המשמעות פשוטה: הוא מחזיק דפוסים בסיסיים, אבל אין לו את הקיבולת להבין תחביר עדין.

מתאים ל

  • סיווג טקסט על מכשירי קצה

    הוא שוקל 50 מגה בייט בלבד ומאפשר להריץ סיווג בסיסי ישירות על מעבד מקומי בלי GPU ובלי תלות ברשת.

  • מיצוי ידע ממודל גדול

    הארכיטקטורה נבנתה במקור כדי לשמש כסטודנט שמקבל ידע ממודל ברט מלא ומאפשר הסקה מהירה.

  • סינון ראשוני ומהיר של מידע

    זמן התגובה שלו אפסי, מה שמתאים למיון ראשוני וגס של טקסטים באנגלית בתוך תהליך עיבוד נתונים.

איפה זה נופל

הוא אומן אך ורק על אנגלית באותיות קטנות. עברית לא נתמכת כאן, והוא ייכשל לחלוטין בניתוח טקסט מקומי. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, אבל מעבר לכך המודל פשוט מוגבל ביכולת ההבנה שלו. הציון הנמוך במבחני הסקת מסקנות מראה שלא כדאי לבנות עליו למשימות שדורשות היגיון, אלא רק למיון טקסטים קצר ופשוט מאוד.

שאלות
נפוצות

האם המודל מתאים לעבודה עם טקסט בעברית?

לא. המודל אומן על אנגלית בלבד ומותאם לאותיות קטנות. אם תזינו לו טקסט בעברית תקבלו פלט שגוי כי אוצר המילים שלו לא מכיל את התווים האלה.

האם כדאי להשתמש בו ישירות או שחובה לאמן אותו?

היוצרים מציינים במפורש שהמודל יעיל בעיקר בתהליך של מיצוי ידע ממודל גדול יותר. שימוש בו כמודל בסיס רגיל בלי אימון ייעודי ייתן תוצאות נמוכות ברוב המשימות.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון. עם משקל של כחמישים מגה בייט ופחות מחמישה מיליון פרמטרים, הוא רץ בלי בעיה על מעבד של טלפון, מכשירי קצה או שרת בסיסי בלי כרטיס מסך ייעודי. אין שום היגיון לשלם על שירות חיצוני או API כדי לצרוך מודל כזה, כי העלות החישובית שלו זניחה לחלוטין.

אם הביצועים שלו חלשים מדי למשימה שלכם, יש בסדרה הזו עוד מדרגות כמו גרסאות של ארבע או שמונה שכבות, שמציעות פשרה טובה יותר בין גודל לדיוק. המודל הזה שווה את הריצה רק כשיש אילוץ חומרה אמיתי.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/bert_uncased_L-2_H-128_A-2")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 50.8 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני מאוד. מותר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, להפיץ אותו ולהטמיע אותו בתוך מוצר בלי לשלם תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗