GPT
D

dse-qwen2-2b-mrl-v1

קוד פתוח

MrLightapache-2.02024-09-11

  • Tevatron
  • pytorch
  • qwen2_vl
  • vidore
  • visual-document-retrieval

במקום לפרק קובצי PDF לטקסט ולמחוק את העיצוב, המודל ממיר צילומי מסך ישירות לווקטורים. מי שצריך לשלוף מסמכים מורכבים עם גרפים וטבלאות יקבל פה דיוק גבוה בלי OCR.

  • 32,768טוקנים בהקשר
  • 4.1 GBמשקל הקבצים
  • 10,597הורדות בחודש
  • 68לייקים

מה זה

במקום להסתבך עם ספריות פירוק מסמכים ששוברות עמודות ומאבדות תמונות, הדבר הזה לוקח צילום מסך של העמוד ומייצר ממנו וקטור חיפוש. הבסיס הוא Qwen2 בנפח של שני מיליארד פרמטרים, אבל עם תוספת ראייה ממוחשבת ואימון ייעודי לשליפה חזותית. הוא יודע לעכל דפי אינטרנט, שקפים ומסמכי PDF, וגם טקסט רגיל כי אימנו אותו מראש על מסדי טקסט כמו מרקו.

התוצאה בלוח המבחנים של ViDoRE עומדת על 85.8 בציון nDCG בחמשת הפריטים הראשונים. בפועל זה אומר שכשאתם מחפשים שאילתת טקסט מול מאגר תמונות של מסמכים, הסיכוי שהעמוד המדויק יקפוץ בראש התוצאות גבוה מאוד ביחס לגודל הקטן שלו.

מתאים ל

  • חיפוש במצגות ושקפים

    הוא מזהה מיקום אלמנטים ותרשימים לצד הכיתוב בלי צורך להפריד ביניהם ידנית.

  • שליפת דפי חשבונות וקבלות

    הטבלאות והמבנה הגרפי נשמרים כפי שהם, מה שמונע את הבלבול שנוצר בפירוק טקסט רגיל.

  • אינדוקס צילומי אתרים

    מאפשר לשלוף דפי אינטרנט שלמים לפי שאילתת טקסט ישירות מתוך תמונת הדף.

איפה זה נופל

המודל תומך רשמית רק באנגלית ובצרפתית, כך שחיפוש או מסמכים בעברית עלולים להניב תוצאות עקומות או להיכשל לחלוטין. מעבר לזה, תמונות ברזולוציה גבוהה מקפיצות את צריכת הזיכרון ברגע, והקטנה שלהן עלולה למחוק אותיות קטנות מדי במסמך. צריך לבדוק היטב איך הוא מתמודד עם פונטים זעירים לפני שסומכים עליו בעיניים עצומות.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים בעברית?

הוא אומן על אנגלית וצרפתית בלבד, ולכן לא הייתי בונה עליו למסמכים מקומיים. טקסט בעברית בתוך תמונה עשוי להניב וקטורים אקראיים לחלוטין, ומומלץ לבצע בדיקת היתכנות קצרה לפני שמשקיעים בפיתוח.

למה כרטיס המסך שלי קורס מחוסר זיכרון למרות שמדובר במודל קטן?

רכיב הראייה של Qwen רגיש מאוד לרזולוציית התמונה, ותמונה כבדה שותה את זיכרון הכרטיס מיד. הפתרון הוא להגביל את ממדי התמונה ל־680 על 680 פיקסלים בתוך המעבד כפי שמוסבר בתיעוד.

איך מריצים

המשקל הכולל יושב על קצת יותר מארבעה גיגהבייט בפורמט bfloat16, כך שכרטיס מסך בודד עם 8 עד 12 גיגהבייט זיכרון יספיק כדי להרים אותו מקומית. הטעינה נעשית דרך transformers עם Flash Attention כדי לשמור על מהירות וחיסכון במשאבים.

עקב האכילס של הריצה הוא גודל התמונה הנכנסת. המפתח ממליץ להגביל מראש את הרזולוציה ל־680 על 680 פיקסלים אם הזיכרון מתחיל להיחנק, ושימוש בטכניקת MRL מאפשר לקצץ את אורך הווקטור בלי לאמן מחדש. אם אין לכם שרת עם מאיץ גרפי זמין ורציף, קריאה לשרת חיצוני חוסכת את כאב הראש של ניהול זיכרון התמונות.

pip install -U huggingface_hub
hf download MrLight/dse-qwen2-2b-mrl-v1

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצרים. הדרישה היחידה היא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי חובה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗