GPT
M

MonoQwen2-VL-v0.1

קוד פתוח

lightonaiapache-2.02024-10-25

  • peft
  • safetensors
  • vidore
  • reranker
  • qwen2_vl

מתאם LoRA קטן שמתלבש על מודל ראייה כדי לדרג מחדש מסמכים סרוקים ותמונות מול שאילתת חיפוש. הוא מפיק ציון רלוונטיות ישיר ומקפיץ את הדיוק של שלב השליפה במערכות RAG מבוססות תמונה.

  • 152 MBמשקל הקבצים
  • 1,722הורדות בחודש
  • 48לייקים

מה זה

המשקל שאתם מורידים כאן שוקל בסך הכול 152 מגה־בייט, כי מדובר במתאם LoRA שמתלבש על מודל הבסיס Qwen2-VL-2B-Instruct. המטרה שלו היא לבצע רירנקינג נקודתי לפי גישת MonoT5. אתם מזינים לו תמונה של עמוד או טקסט יחד עם שאילתה, והוא בודק את הסיכוי שהתשובה הנכונה היא אמת או שקר וממיר את זה לציון הסתברותי.

האימון נעשה על דאטה־סט של ColPali עם דוגמאות שליליות שנשלפו באמצעות DSE. במבחני ViDoRe על עשרה מסמכים שנשלפו מראש, הדירוג מחדש העלה את ממוצע ה־ndcg@5 מ־85.8 ל־90.5. השיפור מורגש במיוחד במסמכים עמוסי נתונים כמו tatdqa שם הציון קפץ מ־69.4 ל־79.0, או shiftproject שעלה מ־82.0 ל־93.0.

מתאים ל

  • דירוג עמודי PDF סרוקים

    סינון עמודים שמכילים גרפים וטבלאות אחרי שליפה ראשונית, כדי להעביר ל־LLM רק את הדף המדויק.

  • סינון תוצאות סף בחיפוש

    חיתוך מועמדים לא רלוונטיים לפי סף הסתברות קבוע מראש, בלי להסתמך רק על סדר התוצאות.

  • שיפור RAG ויזואלי קיים

    שילוב כשלב שני מעל שולף כמו DSE כדי לתקן טעויות דירוג ולשפר את ה־ndcg בכחמש נקודות.

איפה זה נופל

המודל הזה הוא שלב שני בלבד. הוא לא מחפש במאגר של מיליון עמודים אלא רק מדרג קבוצה קטנה שכבר שלפתם קודם בעזרת כלי כמו ColPali או DSE. אם השולף הראשוני פספס את העמוד הרלוונטי, הרירנקר לא יעזור.

בנוסף, במסמכים מסוג docvqa התוצאות נשארות נמוכות יחסית, עם עלייה קטנה בלבד מ־57.1 ל־59.7. צריך גם לקחת בחשבון שריצה של מודל ראייה על כל מועמד לוקחת זמן חישובי, מה שיכול להוסיף השהיה מורגשת לפני שמחזירים תשובה למשתמש.

שאלות
נפוצות

האם הקובץ של 152 מגה־בייט כולל את כל מה שצריך כדי להריץ?

לא. מדובר רק במשקלי LoRA. בזמן הטעינה הראשונה הספרייה תוריד ברקע את מודל הבסיס Qwen2-VL-2B-Instruct, שלוקח כמה גיגה־בייט של נפח וזיכרון.

אפשר להשתמש בו לחיפוש טקסט רגיל בלי תמונות בכלל?

כן, המימוש תומך גם בהעברת פסקאות טקסט רגילות במקום תמונות. עם זאת, היתרון המרכזי שלו מגיע מהיכולת לקרוא ולהבין מבנה של עמודים מעוצבים, תרשימים וטבלאות.

איך מריצים

ההרצה נעשית באמצעות ספריית sentence-transformers מגרסה 5.6.0 ומעלה יחד עם peft, או ישירות דרך transformers. הספרייה טוענת בעצמה את משקלי הבסיס של Qwen2-VL-2B ב־bfloat16 ומלבישה עליהם את המתאם. אתם מעבירים לתוך CrossEncoder נתיב לתמונה, קישור רשת, או אובייקט תמונה רגיל ומקבלים מערך ציונים.

למרות שהמתאם קטן מאוד, תצטרכו כרטיס מסך שיכול להחזיק מודל ראייה של שני מיליארד פרמטרים. עבור הרצה של עשרות עמודים במקביל צריך GPU עם לפחות 8 עד 12 גיגה־בייט זיכרון. אם אין לכם שרת עם כרטיס גרפי מתאים, הרצה מקומית על מעבד תהיה אטית מדי לדירוג בזמן אמת.

pip install -U huggingface_hub
hf download lightonai/MonoQwen2-VL-v0.1

הרישיון

המתאם מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חופשית ללא תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי. שימו לב שתצטרכו לוודא גם את תנאי הרישיון של מודל הבסיס שעליו הוא מתלבש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗