GPT
B

bert-large-portuguese-cased

קוד פתוח

neuralmindmit2022-03-02

  • transformers
  • pytorch
  • jax
  • bert
  • fill-mask

זה מודל מסוג BERT שאומן ספציפית על פורטוגזית ברזילאית. אם אתם צריכים לחלץ ישויות, למדוד דמיון בין משפטים או לסווג טקסטים בפורטוגזית, הוא הבחירה הישירה.

  • 512טוקנים בהקשר
  • 2.5 GBמשקל הקבצים
  • 1,636,037הורדות בחודש
  • 74לייקים

מה זה

מדובר במודל BERT-Large שמכיל 335 מיליון פרמטרים ו־24 שכבות, ומיועד לשפה הפורטוגזית בניב הברזילאי שלו. הוא שומר על אותיות גדולות וקטנות, מה שעוזר במיוחד בזיהוי שמות, מותגים וראשי תיבות. היוצרים שלו בחנו אותו על שלוש משימות קלאסיות בעיבוד שפה: זיהוי ישויות (NER), דמיון בין משפטים והיסק טקסטואלי, ובכולן הוא הציג ביצועים מובילים לתקופתו.

בניגוד למודלים רב־לשוניים כלליים כמו mBERT שמחלקים את אוצר המילים בין עשרות שפות, כאן כל המרחב הטוקני והייצוגים מוקדשים לפורטוגזית. המשמעות היא הבנה טובה יותר של ביטויים מקומיים, מורפולוגיה ודקויות תחביריות שלא תמיד עוברות במודל כללי.

מתאים ל

  • זיהוי ישויות בפורטוגזית

    שליפת שמות, מקומות וארגונים מטקסטים בברזילאית, הודות לשימור אותיות גדולות וקטנות.

  • בדיקת דמיון סמנטי

    השוואת משפטים ובדיקת כפילויות בתוכן או פניות שירות לקוחות בפורטוגזית.

  • השלמת מילים חסרות

    משימות fill-mask להבנת הקשר וניתוח תחבירי ישיר על טקסטים מקומיים.

איפה זה נופל

זה מודל מסוג Encoder בלבד, הוא לא מייצר טקסט חדש, לא מנהל שיחות ולא עונה על שאלות פתוחות כמו מודלים מסוג GPT. חלון ההקשר שלו מוגבל ל־512 טוקנים, כך שטקסטים ארוכים, חוזים או מאמרים שלמים יחייבו חיתוך או פירוק למקטעים.

בנוסף, הוא אומן על פורטוגזית ברזילאית ולא על פורטוגזית של פורטוגל, ויש הבדלים ברורים באוצר המילים ובתחביר. בעברית או באנגלית אין לו שום יתרון, והרצת 335 מיליון פרמטרים בסביבת ייצור מחייבת משאבי חישוב ייעודיים שלא תמיד מוצדקים לכל בעיה.

שאלות
נפוצות

האם הוא מתאים לפורטוגזית מאירופה?

הוא אומן ומכוון לפורטוגזית ברזילאית. הוא יבין חלק גדול מהמילים בגלל הבסיס המשותף, אבל עלול לטעות בביטויים מקומיים, איות שונה ומבנים תחביריים של פורטוגל.

האם הוא יודע לכתוב טקסט חופשי?

לא. מדובר בארכיטקטורת BERT שמיועדת לקרוא ולהבין טקסט, לייצר וקטורים או למלא מילים חסרות, ולא לייצר פסקאות חדשות.

מה ההבדל בינו לבין גרסת ה־Base?

הגרסה הזו גדולה פי שלושה בערך במספר הפרמטרים, עם 24 שכבות לעומת 12. היא מדויקת יותר במשימות מורכבות אך דורשת יותר זיכרון ורצה לאט יותר.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות AutoModel או AutoModelForPreTraining. המשקל הכולל של הקבצים עומד על 2.5 גיגה־בייט, כך שהוא נכנס בקלות לכרטיס מסך ביתי סביר או מופע ענן בסיסי עם 8 גיגה זיכרון וידאו ומעלה להסקה. אם אתם מתכננים אימון נוסף, תצטרכו חומרה חזקה יותר.

יש למפתח גם גרסת Base קטנה יותר עם 110 מיליון פרמטרים ו־12 שכבות. אם זמן התגובה הוא קריטי בשרת או שהתקציב דחוק, שווה לבדוק קודם את גרסת הבסיס. אם התוצאות לא מדויקות מספיק למשימה שלכם, עוברים לגרסה הזו.

from transformers import pipeline

pipe = pipeline("fill-mask", model="neuralmind/bert-large-portuguese-cased")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT. המשמעות פשוטה: אפשר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וקוד סגור, לשנות אותו ולאמן אותו על הנתונים שלכם. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ותנאי הרישיון המקוריים בחלוקת הקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗