GPT
D

distiluse-base-multilingual-cased-v1

קוד פתוח

sentence-transformersapache-2.02022-03-02

  • sentence-transformers
  • pytorch
  • tf
  • onnx
  • safetensors

המודל הזה ממיר טקסטים בכמה שפות לווקטורים קומפקטיים של 512 ממדים. הוא מתאים למי שצריך חיפוש סמנטי מהיר בלי להחזיק תשתית כבדה.

  • 135Mפרמטרים
  • 512טוקנים בהקשר
  • 4.9 GBמשקל הקבצים
  • 1,017,693הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת DistilBERT עם 135 מיליון פרמטרים, שנועד לייצר וקטורים להשוואת משפטים, קלאסטרינג וחיפוש סמנטי. הייחוד המרכזי שלו הוא התמיכה המובנית במספר שפות, כולל ערבית, אנגלית, צרפתית, גרמנית, הולנדית, איטלקית וסינית. הוא לוקח ייצוג של 768 ממדים ומצמצם אותו לשכבה דחוסה של 512 ממדים בעזרת פונקציית אקטיבציה מסוג Tanh.

הגודל הקומפקטי שלו הופך אותו לפתרון פשוט ליישום כשרוצים להשוות בין שפות שונות בלי להסתבך עם מודלי ענק. הוא לא מייצר טקסט ולא עונה על שאלות בצורה חופשית, אלא מתרכז אך ורק במיפוי המשמעות של משפטים ופסקאות למרחב וקטורי.

מתאים ל

  • חיפוש סמנטי רב-לשוני

    התאמת שאילתות למסמכים קצרים על פני שפות שונות כמו אנגלית, ערבית וצרפתית.

  • קיבוץ משפטים לנושאים

    הפקת וקטורים בגודל 512 ממדים לצורך קלאסטרינג מהיר וזול של הודעות קצרות.

  • בדיקת כפילויות בטקסט

    מדידת דמיון סמנטי בין שאלות או כותרות כדי למנוע חזרות במאגרי מידע.

איפה זה נופל

למרות שמוגדר חלון הקשר של 512 טוקנים, הארכיטקטורה הפנימית מוגדרת עם max_seq_length של 128 טוקנים בלבד. זה אומר שטקסטים ארוכים ייחתכו מוקדם מאוד, והוא פשוט לא מתאים למסמכים מלאים אלא למשפטים קצרים בלבד. בנוסף, עברית לא מופיעה ברשימת השפות הנתמכות שפורסמה, כך שמי שבונה עליו לטקסט מקומי יקבל תוצאות חלשות ולא מדויקות.

אותה משפחה

distiluse-base-multilingual-cased יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לחיפוש במסמכים ארוכים?

לא. הארכיטקטורה מגבילה את האורך ל־128 טוקנים בפועל, כך שכל תוכן מעבר לכך פשוט ייחתך. לטקסטים ארוכים עדיף לחפש מודל שמיועד לפסקאות שלמות או לפרק את המידע למשפטים בודדים.

האם אפשר להשתמש בו לטקסט בעברית?

העברית לא נכללת ברשימת השפות הרשמית של המודל. אף על פי שהוא מוגדר כמולטילינגואל, הדיוק בעברית צפוי להיות נמוך בהרבה לעומת השפות שנתמכות במפורש בכרטיס.

איך מריצים

טוענים אותו ישירות דרך ספריית sentence-transformers בפייתון עם שורות קוד בודדות. בגלל שמדובר ב־135 מיליון פרמטרים בלבד, אפשר להריץ אותו בקלות על מעבד רגיל בכל שרת פשוט, בלי שום חובה להחזיק כרטיס מסך ייעודי.

אם אתם צריכים לחשב וקטורים לכמויות עצומות של טקסט בזמן קצר, כרטיס מסך בסיסי יאיץ את העבודה משמעותית. שימוש ב־API חיצוני יהיה הגיוני רק אם אתם לא רוצים לנהל שרתים בכלל, אבל המשקל הנמוך של המודל הופך הרצה עצמית לזולה ופשוטה מאוד לתחזוקה שוטפת.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("sentence-transformers/distiluse-base-multilingual-cased-v1")
v = m.encode(["שלום עולם"])

הרישיון

המודל מופץ תחת רישיון apache-2.0. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או ללקוחות, בתנאי ששומרים על הודעת זכויות היוצרים המקורית והטקסט של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗