GPT
D

distilbert-base-multilingual-cased

קוד פתוח

distilbertapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • onnx
  • safetensors

גרסה מזוקקת, קלה ומהירה פי שניים של mBERT שתומכת ב־104 שפות. מתאימה למי שצריך סיווג או תיוג טקסט רב-לשוני מקומי בלי להחזיק שרתים כבדים.

  • 135Mפרמטרים
  • 512טוקנים בהקשר
  • 2.7 GBמשקל הקבצים
  • 494,701הורדות בחודש

מה זה

זהו עיבוד מזוקק של mBERT מבית Hugging Face, שנועד לתת מענה לעיבוד שפה ב־104 שפות שונות עם ארכיטקטורה מכווצת של 6 שכבות ו־135 מיליון פרמטרים. המטרה המרכזית שלו היא לאפשר משימות הבנת שפה כמו סיווג טקסט, זיהוי ישויות או מענה על שאלות, בלי לשלם את מחיר האיטיות של המודל המקורי. המודל שומר על רגישות לאותיות גדולות וקטנות באנגלית ובשפות לטיניות אחרות.

הוא אומן על ערכי ויקיפדיה בכל השפות הנתמכות תחת פיקוח של המודל המלא. במבחני XNLI במצב zero shot, הוא מאבד כמה אחוזי דיוק ביחס למקור: באנגלית הוא עומד על 78.2 לעומת 82.1, ובערבית הוא מגיע ל־59.1 לעומת 66.4. הפשרה ברורה, אתם מוותרים על מעט ביצועים בתמורה למהירות כפולה, מה שהופך אותו לפתרון פרקטי למערכות שרצות בזמן אמת.

מתאים ל

  • סיווג טקסט רב-לשוני

    אימון נוסף למיון פניות לקוחות בעשרות שפות שונות בו-זמנית על תשתית שרתים רזה וזולה.

  • חילוץ ישויות ומילות מפתח

    זיהוי שמות, מקומות ומושגים בטקסטים קצרים בזכות רגישות לאותיות גדולות ומהירות ריצה גבוהה.

  • מענה על שאלות מתוך קטע

    שליפת תשובות מתוך פסקאות נתונות בעד 104 שפות, כאשר זמן התגובה של המערכת הוא קריטי.

איפה זה נופל

המודל הזה מיועד למשימות אנליטיות כמו סיווג והשלמת מילים מוסתרות, והוא לא מתאים בכלל ליצירת טקסט חופשי. מבחני הדיוק מראים ירידה מורגשת בשפות שאינן אנגלית, כמו ערבית שמגיעה ל־59.1 בלבד. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שטקסטים ארוכים ייחתכו. המפתחים מציינים במפורש שהאימון על ויקיפדיה כולל הטיות וסטריאוטיפים חברתיים, ושהפלט אינו מייצג עובדות אמינות על אנשים או אירועים.

שאלות
נפוצות

האם אפשר להשתמש בו כמו ב־ChatGPT ליצירת תוכן?

לא. מדובר במודל שמנתח טקסט ומנחש מילים מוסתרות, ולא במודל שמייצר טקסטים או מנהל שיחות. בשביל יצירת טקסט אתם צריכים לפנות לארכיטקטורות אחרות כמו סדרת GPT.

האם כדאי להשתמש בו ישירות בלי fine-tuning?

ברוב המקרים לא. המודל הגולמי בעיקר משלים מילים מוסתרות או לומד ייצוגים. כדי לקבל תוצאות טובות במוצר אמיתי, צריך לאמן עליו שכבת סיווג או תיוג עם הנתונים הספציפיים שלכם.

איך מריצים

אתם מריצים אותו ישירות דרך ספריית transformers בפייתון עם המשימה fill-mask, או טוענים אותו כבסיס לאימון downstream. עם משקל כולל של 2.7 גיגה-בייט ו־135 מיליון פרמטרים בלבד, אין שום צורך בכרטיסי מסך תעשייתיים מיוחדים. הוא רץ בקלות על מעבד רגיל של שרת פשוט או על מחשב פיתוח אישי, ותופס מעט מאוד זיכרון בהשוואה למודלים מודרניים אחרים.

בגלל הגודל הצנוע שלו, אין סיבה אמיתית לשלם על שירותי API חיצוניים כדי להפעיל אותו. הרצה עצמית בתוך הקוד שלכם תחסוך עלויות ענן ותמנע תלות ברשת, אלא אם אתם בונים מערכת שמבוססת לחלוטין על שירותים מנוהלים ואין לכם שרת פייתון קיים להריץ עליו את המודל.

from transformers import pipeline

pipe = pipeline("fill-mask", model="distilbert/distilbert-base-multilingual-cased")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של המשקולות והפצה במוצר שלכם. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי בקבצים שאתם מספקים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗