GPT
M

mxbai-rerank-xsmall-v1

קוד פתוח

mixedbread-aiapache-2.02024-02-29

  • transformers
  • onnx
  • safetensors
  • deberta-v2
  • text-classification

ריראנקר קומפקטי במיוחד של 71 מיליון פרמטרים שמיועד לדירוג מחדש של מסמכים באנגלית. הוא פותר צווארי בקבוק של זמני תגובה ומשאבים במערכות חיפוש קיימות.

  • 71Mפרמטרים
  • 512טוקנים בהקשר
  • 500 MBמשקל הקבצים
  • 615,620הורדות בחודש

מה זה

המודל מבצע משימת Text Ranking ומבוסס על ארכיטקטורת DebertaV2 עבור סיווג רצפים, עם 12 שכבות ומשקל כולל של כחצי ג'יגה בייט בקובצי המשקולות. תפקידו הוא לקבל שאילתה ומספר קטעי טקסט, ולדרג אותם לפי מידת הרלוונטיות לשאילתה.

הייחוד העיקרי כאן הוא המשקל הנמוך. רוב מודלי הדירוג בשוק כבדים משמעותית ודורשים כרטיסי מסך חזקים, בעוד הגודל הזה נבנה כדי לפעול מהר ובמינימום משאבים. הוא מיועד למערכות שבהן שליפה וקטורית ראשונית מחזירה עשרות תוצאות, ונדרש שלב סינון מדויק יותר בלי לפגוע בזמן התגובה למשתמש.

מתאים ל

  • דירוג תוצאות בחיפוש RAG

    סינון עשרות פסקאות שהוחזרו משליפה וקטורית כדי להגיש למודל השפה רק את הקטעים המדויקים ביותר באנגלית.

  • ריצה מקומית על שרתי CPU

    הוספת שלב ריראנקינג למערכת חיפוש קיימת בלי להוסיף כרטיס מסך ייעודי ובלי להגדיל את עלויות השרתים.

  • האצת זמני תגובה בחיפוש

    שילוב במערכות שבהן מודלי ריראנקינג גדולים יותר מייצרים השהיה גבוהה מדי עבור המשתמש.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים בלבד. אי אפשר להזין לתוכו מסמכים ארוכים, אלא רק פסקאות קצרות או תקצירים, אחרת הטקסט ייחתך ותאבדו מידע. המגבלה הקריטית ביותר לקורא המקומי היא השפה. המודל מאומן ומוגדר רשמית לאנגלית בלבד, כך שלא הייתי מנסה להכניס אותו לפרודקשן שמטפל בשאילתות או במסמכים בעברית בלי בדיקה קפדנית, וכנראה שהוא לא יתאים לשם.

שאלות
נפוצות

האם המודל מתאים לחיפוש בעברית?

המודל מוגדר ומאומן רשמית עבור אנגלית בלבד. סביר להניח שהביצועים שלו על טקסטים בעברית יהיו נמוכים מאוד, ולכן הוא לא מתאים למאגרי מידע מקומיים.

כמה זיכרון נדרש כדי לטעון אותו לשרת?

קבצי המודל שוקלים כחצי ג'יגה בייט בפורמט float16. בפועל, תצטרכו זיכרון עבודה בסיסי ביותר של פחות מ־2GB בשרת כדי לטעון ולהריץ אותו בנוחות.

איך מריצים

בזכות משקל של 500 מגה בייט ודיוק float16, אין חובה להחזיק כרטיס מסך ייעודי בשרת. אפשר להריץ אותו ישירות על מעבד רגיל של שרת ענן פשוט, בקונטיינר קל, באמצעות ספריית transformers התקנית של פייתון.

הריצה העצמית פשוטה מאוד ולא דורשת תשתיות מורכבות או ניהול זיכרון כבד. במקרה של המודל הזה, אין סיבה אמיתית לשלם על API חיצוני אם יש לכם שרת יישומים שכבר רץ, אלא אם אתם מנהלים עומס עצום של מיליוני שאילתות ומעדיפים שמישהו אחר יתעסק בסקיילינג.

from transformers import pipeline

pipe = pipeline("text-ranking", model="mixedbread-ai/mxbai-rerank-xsmall-v1")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗