GPT
J

jina-reranker-m0

קוד פתוח

jinaaicc-by-nc-4.02025-03-27

  • transformers
  • safetensors
  • qwen2_vl
  • feature-extraction
  • sentence-transformers

יש כאן גם סקירה על Jina AI עצמו.

ריראנקר מולטימודלי של 2.4 מיליארד פרמטרים, שמדרג תמונות מסמכים, טבלאות וטקסט לפי שאילתה. הוא מתאים למי שבונה חיפוש ויזואלי ולא רוצה להסתמך רק על חילוץ OCR.

  • 2.4Bפרמטרים
  • 32,768טוקנים בהקשר
  • 4.6 GBמשקל הקבצים
  • 383,310הורדות בחודש

מה זה

המודל הזה מבוסס על מודל השפה הוויזואלי Qwen2-VL-2B-Instruct עם אימון LoRA וראש MLP ייעודי לדירוג. בשונה מריראנקרים רגילים שמתבססים על Cross-Encoder טקסטואלי קלאסי, המערכת הזו מקבלת עמודי מסמכים כאימג'ים שלמים ומבינה את הסידור הגרפי, הדיאגרמות והטבלאות ישירות מהפיקסלים. הוא מעבד שילובים של טקסט מול טקסט, טקסט מול תמונה, תמונה מול תמונה, וטקסט מול מסמך מעורב.

הוא מיועד לתמוך ביותר מ־29 שפות וכולל תמיכה בחיפוש קוד ובמסמכים ארוכים. בעוד שהמטאדטה מציין חלון של 32,768 טוקנים, כרטיס המודל מגדיר בפועל אורך הקשר מרבי של 10,240 טוקנים לשאילתה ולמסמך יחד. הוא מקבל תמונות ברזולוציות דינמיות שנעות מ־56 על 56 פיקסלים ועד לאיכות 4K, מה שמאפשר לו לקרוא פונטים קטנים מתוך עמודי PDF סרוקים בלי לחתוך אותם מראש.

בבנצ'מרקים המודל נמדד מול ViDoRe, MBEIR ו־Winoground למשימות מולטימודליות, ובנוסף מול מבחני טקסט שונים עם מדדי NDCG@10 ו־Recall@10 עבור MKQA. המדידות מראות יכולת הכללה לא רעה על פני תחומים ושפות שונות בלי אימון ייעודי מראש, אבל התוצאות המפורטות עצמן נשמרות בגיליון חיצוני ולא מופיעות כמספרים בודדים בתוך הכרטיס.

מתאים ל

  • חיפוש במאמרים ודוחות סרוקים

    דירוג עמודי PDF שמכילים תרשימים וטבלאות ישירות מתוך התמונה, בלי לאבד מידע בתהליך ה־OCR.

  • מערכות RAG לקוד ומסמכים טכניים

    שליפת קטעי תכנות ודוקומנטציה טכנית ארוכה בזכות תמיכה בעשרת אלפים טוקנים ואימון ייעודי לחיפוש קוד.

  • חיפוש תמונות באמצעות תמונות

    קבלת תמונה כשאילתה והחזרת מסמכים ויזואליים דומים ומדורגים ברמת דיוק גבוהה ללא המרה לטקסט.

איפה זה נופל

הקוד דורש הרצה של קוד מרוחק עם trust_remote_code, שזה סיכון אבטחה שצריך לבדוק לפני שמכניסים אותו לתשתיות סגורות. בנוסף, יש פער מטריד בין הנתונים, המטאדטה מדווח על הקשר של 32,768 טוקנים אבל הכרטיס מגביל מפורשות ל־10,240 טוקנים. צריך לזכור שעיבוד תמונות ברזולוציה גבוהה של עד 4K דורש זיכרון וידאו משמעותי ומאט את קצב הדירוג בהשוואה לריראנקרים טקסטואליים קלים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי של החברה שלי?

לא ישירות מהמשקלים הפתוחים. רישיון cc-by-nc-4.0 אוסר שימוש מסחרי, כך שאם אתם מריצים אותו בעצמכם בתוך מוצר רווחי, אתם מחויבים לפנות ל־Jina AI לקבלת רישיון מסחרי, או להשתמש בגרסאות שלהם ב־AWS, Azure או GCP.

מה עדיף, להריץ אותו מקומית או לקרוא ל־API?

אם יש לכם כרטיס מסך חזק כמו RTX 4090 או A100 ואתם צריכים פרטיות מלאה, הרצה עצמית אפשרית וסבירה. אם אתם צריכים מענה מהיר להרבה משתמשים ואין לכם שרתי GPU ייעודיים, עדיף לפנות ישירות ל־API שלהם כי מודל ויזואלי בגודל 2.4B דורש לא מעט משאבים בכל קריאה.

איזה סוגי קלטים המודל יודע לקבל?

הוא תומך בארבעה מצבים שונים: שאילתת טקסט מול מסמכי טקסט, שאילתת טקסט מול תמונות, שאילתת תמונה מול טקסט, ושאילתת תמונה מול תמונות. זה מאפשר לדרג עמודים סרוקים באמצעות שאילתת חיפוש רגילה בלי לעבור דרך שלב של פענוח טקסט.

איך מריצים

המשקל עומד על 4.6 גיגה בייט בדיוק bfloat16, כך שצריך כרטיס מסך מודרני כדי להריץ אותו מקומית. כדי לקבל ביצועים סבירים ולהשתמש ב־FlashAttention-2 צריך חומרה מסדרות Ampere, Ada או Hopper כמו RTX 3090, RTX 4090, A100 או H100, לצד ספריית transformers בגרסה 4.47.3 ומעלה או sentence_transformers.

אם אין לכם כרטיס כזה, אפשר לטעון אותו ל־CPU אבל זמני התגובה יהיו אטיים מאוד לכל שאילתה שכוללת תמונה. במקרים שבהם אין לכם תשתית GPU זמינה או שאתם לא רוצים לנהל שרתים של 2.4B פרמטרים בזמן אמת, קריאה ל־API של Jina או דרך השווקים של AWS, Azure ו־GCP חוסכת את כאב הראש.

from transformers import pipeline

pipe = pipeline("text-classification", model="jinaai/jina-reranker-m0")
print(pipe("שלום"))

הרישיון

הרישיון הוא cc-by-nc-4.0, כלומר שימוש לא מסחרי בלבד. מותר להוריד, לשנות ולבדוק אותו למחקר או פיתוח פנימי, אבל אסור לשלב אותו במוצר מסחרי, באפליקציה בתשלום או בפעילות עסקית מניבה בלי לרכוש רישיון מסחרי נפרד מ־Jina AI או להשתמש בנקודות הקצה שלהם בעננים הציבוריים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗