GPT
B

bge-reranker-v2-m3-GGUF

קוד פתוח

gpustackapache-2.02024-09-29

  • sentence-transformers
  • gguf
  • transformers
  • text-embeddings-inference
  • text-classification

גרסת GGUF שנועדה לדירוג מחדש של תוצאות חיפוש בכמה שפות, ישירות מתוך llama.cpp. היא מקבלת שאילתה ופסקה ופולטת ציון התאמה מדויק במקום וקטורים.

  • 4.5 GBמשקל הקבצים
  • 25,579הורדות בחודש
  • 40לייקים

מה זה

המודל הזה לוקח את bge-reranker-v2-m3 המקורי של BAAI, שמבוסס בעצמו על bge-m3, וממיר אותו לפורמט GGUF על בסיס גרסה f4d2b של llama.cpp. במקום לייצר וקטורים ולהשוות מרחקים כמו מודל שיכוך רגיל, הוא מקבל כקלט זוג של שאילתה וקטע טקסט, ומחזיר ישירות ציון מספרי שמייצג את מידת הרלוונטיות ביניהם. את הציון הזה אפשר להמיר למספר בין אפס לאחד באמצעות פונקציית סיגמואיד.

היתרון שלו על פני מודלים מבוססי שפה גדולים יותר בסדרה, כמו אלה שמבוססים על gemma-2b או MiniCPM, הוא יעילות חישובית גבוהה לצד תמיכה רב-לשונית רחבה. הוא נועד להיות קל משקל ומהיר בהסקה ביחס למודלים של מיליארדי פרמטרים.

מתאים ל

  • סינון תוצאות RAG רב-לשוני

    דירוג מדויק של עשרות פסקאות שנשלפו ממסד נתונים וקטורי בכמה שפות, לפני שליחתן למודל השפה הגדול.

  • מנועי חיפוש פנימיים

    קבלת שאילתה ומסמך ופליטת ציון התאמה ישיר למיון תוצאות חיפוש טקסטואלי מקומי במהירות.

  • הסקה מקומית על מעבד

    הרצה חסכונית במשאבים דרך llama.cpp בסביבות שבהן אין מעבדים גרפיים חזקים או שאין חיבור לרשת.

איפה זה נופל

בכרטיס המודל מצוין בפירוש שאם המטרה היא ביצועים מקסימליים או עבודה ממוקדת באנגלית וסינית בלבד, מודלים כמו gemma-2b או MiniCPM-2B עדיפים עליו. דוגמאות הקוד מגבילות את אורך הקלט ל־512 טוקנים, כך שהוא לא בנוי לקריאת מסמכים שלמים אלא לפסקאות קצרות בלבד. בנוסף, מודל כזה מעבד כל זוג של שאילתה ופסקה בנפרד, מה שיוצר צוואר בקבוק של זמני תגובה אם מנסים לדרג מאות תוצאות בכל שאילתה במקום עשרות בודדות.

שאלות
נפוצות

האם המודל הזה מחזיר וקטורים לתוך מסד נתונים?

לא. מודל reranker אינו מודל שיכוך שמייצר אמבדינגס, אלא מסווג שמקבל שאילתה וקטע טקסט ביחד ופולט ציון התאמה מספרי. משתמשים בו רק בשלב השני של החיפוש כדי לדרג תוצאות שכבר נשלפו.

כמה תוצאות כדאי להעביר לו בכל פעם?

בגלל שהוא מנתח כל צמד של שאילתה ופסקה בנפרד, זמן החישוב עולה ככל שיש יותר תוצאות. הכרטיס מדגים דירוג של 100 התוצאות המובילות, וזה סדר הגודל המומלץ לפני שפוגעים בזמני התגובה של המערכת.

איך מריצים

המודל מחולק ל־16 קבצים במשקל כולל של 4.5 גיגה-בייט. מאחר שמדובר בפורמט GGUF, הוא מיועד לטעינה ישירה דרך llama.cpp או ספריות תואמות, מה שמאפשר להריץ אותו בקלות על מעבדים מרכזיים או על מאיצים גרפיים צנועים בלי צורך בשרת מפלצתי.

אם אתם מחפשים לשלב reranker בצינור RAG מקומי בלי תלות ברשת ובלי תשלום לפי קריאה לשירות חיצוני, הפריסה העצמאית הזו סוגרת את הפינה. פנייה ל־API חיצוני עדיפה רק אם אין לכם שרת ייעודי שמסוגל להחזיק תהליך קבוע בזיכרון של כמה גיגה-בייט.

ollama run hf.co/gpustack/bge-reranker-v2-m3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗