GPT
B

bert-base-german-cased

קוד פתוח

google-bertmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • onnx

זהו מודל שפה ייעודי לגרמנית שמבצע השלמת מילים מוסתרות בטקסט. הוא נבנה כבסיס מדויק למשימות סיווג, ניתוח רגש וחילוץ ישויות בגרמנית עם רגישות לאותיות גדולות וקטנות.

  • 110Mפרמטרים
  • 512טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 421,619הורדות בחודש

מה זה

מדובר במודל BERT קלאסי של 110 מיליון פרמטרים שאומן מראש על טקסטים בגרמנית בלבד. המפתחים מ־deepset הזינו לו כ־12 גיגה בייט של נתונים, שכוללים שילוב של ויקיפדיה בגרמנית, מאגר פסקי דין ומסמכים משפטיים בשם OpenLegalData, וכתבות חדשות. האילוף נעשה על מעבד TPU v2 יחיד במשך תשעה ימים, תחילה באורך רצף קצר ובהמשך עם חלון מלא.

המטרה העיקרית שלו היא לשמש נקודת מוצא להתאמה אישית למשימות עיבוד שפה. הבדיקות שביצעו עליו מראות יציבות גבוהה במשימות זיהוי ישויות עם Conll03 ו־GermEval14, וסיווג מסמכים ורגש עם GermEval18 ו־10kGNAD. העובדה שהוא שומר על אותיות גדולות וקטנות חשובה במיוחד בגרמנית, שבה כל שמות העצם מתחילים באות גדולה, מה שמקטין בלבול בניתוח תחבירי.

מתאים ל

  • חילוץ ישויות בגרמנית

    שומר על אותיות גדולות וקטנות, קריטי לשמות עצם וישויות בגרמנית, ונבדק בהצלחה על Conll03.

  • סיווג מסמכים משפטיים

    אומן ישירות על נתוני OpenLegalData, מה שמקנה לו היכרות טובה עם שפה משפטית גרמנית.

  • ניתוח סנטימנט בגרמנית

    מתאים למיון ביקורות וטקסטים קצרים לאחר אימון קל, כפי שנבדק מול GermEval18.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים בלבד, כך שטקסטים ארוכים כמו חוזים מלאים או מאמרים מעמיקים יחייבו אתכם לחתוך את התוכן מראש. בנוסף, רוב האילוף שלו, 810 אלף צעדים מתוך 840 אלף, נעשה על רצפים קצרים של 128 טוקנים ורק 30 אלף צעדים נותרו לאורך המלא.

המודל מיועד אך ורק לשפה הגרמנית. אם תכניסו טקסט מעורב באנגלית או בעברית, הוא לא ידע מה לעשות איתו ויחזיר תוצאות משובשות. כמו כן, הוא מוגדר כמודל Masked LM, ולכן אינו מייצר טקסט חופשי, תשובות ארוכות או שיחה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית או באנגלית?

לא. המודל אומן על טקסטים בגרמנית בלבד ואוצר המילים שלו מותאם לשפה הזו. הרצת טקסט בעברית תגרום לשגיאות טוקניזציה ותניב תוצאות לא שמישות.

האם המודל מייצר פסקאות ותשובות מלאות לשאלות?

לא, הארכיטקטורה שלו היא BertForMaskedLM שמיועדת להבנת טקסט, ניבוי מילים חסרות וחילוץ מאפיינים. הוא לא מודל יוצר כמו סדרות GPT ואינו מתאים לצ'אטבוטים של יצירת תוכן.

איך מריצים

המודל שוקל 2.2 גיגה בייט ומכיל 110 מיליון פרמטרים ב־12 שכבות, כך שהוא רץ בקלות על מעבד מחשב רגיל או על כרטיס מסך בסיסי עם מעט זיכרון. אתם טוענים אותו דרך ספריית transformers בפייתון בלי סיבוכים מיוחדים. הוא דורש משאבים מזעריים ביחס למודלים מודרניים, ולכן אין סיבה אמיתית לפנות ל־API חיצוני או לשלם על שירותי ענן יקרים כדי להפעיל אותו.

שימו לב לעדכון אוצר המילים שנעשה בו. המודל הנוכחי כולל התאמה לסימני פיסוק סטנדרטיים, וקיים גם מודל נפרד תחת השם bert-base-german-cased-oldvocab אם אתם עובדים עם מערכות ישנות יותר שמסתמכות על הגרסה הראשונית.

from transformers import pipeline

pipe = pipeline("fill-mask", model="google-bert/bert-base-german-cased")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT, אחד הרישיונות המתירניים ביותר שיש. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצר סגור ולהפיץ אותו הלאה. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצי הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗