GPT
G

gbert-large

קוד פתוח

deepsetmit2022-03-02

  • transformers
  • pytorch
  • tf
  • safetensors
  • fill-mask

מודל שפה בגודל 337 מיליון פרמטרים שמיועד לגרמנית בלבד. הוא מתאים למי שצריך מודל ייעודי להבנת טקסט גרמני ומחפש דיוק גבוה יותר מגרסאות הבסיס הישנות.

  • 337Mפרמטרים
  • 512טוקנים בהקשר
  • 3.9 GBמשקל הקבצים
  • 14,818הורדות בחודש

מה זה

מדובר במודל BERT גדול בגרמנית שפותח בשיתוף פעולה של deepset עם יוצרי מודלים גרמניים קודמים. הוא אומן ישירות על גרמנית במקום להסתמך על מודל רב לשוני כללי. המטרה המקורית שלו היא השלמת מילים חסרות בטקסט, אבל בפועל מורידים אותו כבסיס לאימון המשך למשימות סיווג, זיהוי ישויות או חילוץ מידע.

במדדי הביצועים המדווחים הוא מציג תוצאות טובות במבחני GermEval, כולל ציון 88.16 במשימת GermEval14 וציון 80.08 בסיווג גס ב־GermEval18. התוצאות האלה מראות שהוא מזהה מבנים דקדוקיים וסמנטיקה גרמנית ברמה מדויקת, אם כי בסיווג דק הוא יורד לציון 52.48, מה שאומר שמשימות מורכבות וספציפיות מאוד עדיין מאתגרות אותו.

מתאים ל

  • סיווג טקסטים בגרמנית

    בסיס מתאים למיון מסמכים, ניתוח רגש וזיהוי כוונות משתמש בגרמנית אחרי כוונון עדין.

  • זיהוי ישויות בגרמנית

    התוצאות הגבוהות ב־GermEval14 הופכות אותו לבחירה טובה לחילוץ שמות ומיקומים מטקסט.

  • השלמת מילים חסרות

    הארכיטקטורה המקורית שלו מיועדת בדיוק לחיזוי מילים מוסתרות בתוך משפטים בגרמנית.

איפה זה נופל

הוא מוגבל לחלון של 512 טוקנים, כך שטקסטים ארוכים כמו מסמכים משפטיים או מאמרים שלמים יחייבו חיתוך. בנוסף, הוא יודע גרמנית בלבד. אין לו תמיכה בעברית או באנגלית, ואי אפשר לנהל איתו שיחה חופשית כי הוא לא מודל ג'נרטיבי ליצירת טקסט.

שאלות
נפוצות

האם אפשר להשתמש בו ליישומי טקסט בעברית?

לא. המודל אומן על טקסטים בגרמנית בלבד, ואוצר המילים והמשקולות שלו לא כוללים עברית.

האם הוא יכול לשמש כצ'אטבוט?

לא ישירות. זהו מודל מסוג BertForMaskedLM שמיועד להבנת טקסט וסיווג, ולא מודל שמייצר תשובות ארוכות בשיחה.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־3.9 גיגה בייט, כך שאפשר להריץ אותו על מעבד גרפי סטנדרטי עם 8 או 16 גיגה בייט זיכרון בלי בעיה מיוחדת. הוא רץ ישירות דרך ספריית transformers בפייתון.

גרסת הלארג' הזו כבדה יותר מגרסאות הבייס המקבילות, ותדרוש יותר משאבים בזמן אימון או היסק. אם אתם צריכים רק שאילתות בודדות או עיבוד פשוט פעם ביום, הקמה ותחזוקה של שרת ייעודי עבורו תהיה מיותרת ועדיף להשתמש בתשתית ענן מוכנה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="deepset/gbert-large")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 3.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הוא מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות אותו, לאמן עליו מודלים פנימיים ולשלב אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗