GPT
E

EVIE-Preview-4.5B

קוד פתוח

tencentapache-2.02026-08-17

  • colpali-engine
  • safetensors
  • qwen3_5
  • visual-document-retrieval
  • vision-language

מודל חיפוש מסמכים ויזואלי שממיר עמודי PDF לתמונות ומאחזר אותם ישירות לפי שאילתת טקסט. הוא מתאים למי שרוצה לדלג על OCR מסורתי בלי לשלם בנפח אינדקס מנופח.

  • 4.5Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.5 GBמשקל הקבצים
  • 2,444הורדות בחודש

מה זה

המודל פועל כמאחזר מסמכים מבוסס ראייה שנשען על ColQwen3_5 ומשתמש במנגנון Late Interaction מסוג MaxSim. במקום לחלץ טקסט שבור מטבלאות ומגרפים, מעבירים אליו את צילום העמוד ישירות והוא מייצר וקטורים צפופים ברמת הטוקן. בניגוד למודלים דומים שפולטים וקטורים של 640 ממדים, כאן כל טוקן מיוצג ב־128 ממדים בלבד, מה שמקצץ ישירות את נפח האחסון ואת זמני החישוב בריצה.

במבחני ViDoRe V3 הוא הגיע לציון 65.36 והתברג במקום הראשון, מעל מודלים כפולים ממנו בגודל. התוצאה הזו מראה שהוא מצליח לתפוס מבנה חזותי עשיר, כמו גרפים מדעיים ודוחות כספיים, בלי להזדקק למודל שפה ענק ברקע.

מתאים ל

  • חיפוש דוחות כספיים

    שליפת עמודים עם טבלאות ומאזנים מורכבים ישירות מתוך קובצי תמונה, בלי תלות בפיענוח OCR.

  • אחזור מאמרים מדעיים

    איתור גרפים, תרשימי זרימה ונוסחאות שאינם נשמרים היטב בטקסט רגיל.

  • סריקת טפסים ותעודות

    זיהוי וסיווג מסמכים סרוקים שבהם המבנה החזותי קובע את המשמעות של השדות.

איפה זה נופל

זהו צ'קפוינט מוקדם מסוג Preview, והיוצרים כבר מציינים שקיים דור המשך רשמי עם דחיסה עמוקה יותר. בנוסף, רשימת השפות כוללת אנגלית, צרפתית, גרמנית, איטלקית, ספרדית, פורטוגזית וסינית, לצד תמיכה במסמכים ביפנית. עברית לא נבדקה ולא מופיעה ברשימה, ולכן אי אפשר להסתמך עליו למסמכים מקומיים בלי בדיקה ידנית של איכות הזיהוי.

הוא גם לא יודע לקבל מסמך טקסטואלי טהור כקלט. אם תנסו להזין טקסט כמסמך הוא יתייחס אליו כשאילתה, מה שמחייב אתכם לרנדר כל קובץ לתמונה לפני האינדוקס.

שאלות
נפוצות

האם המודל תומך בעברית?

כרטיס המודל מונה שבע שפות שאילתה בלבד, לצד תמיכה במסמכים ביפנית. עברית אינה נכללת ביניהן, ולכן סביר להניח שהביצועים על טקסט עברי יהיו נמוכים או לא שמישים כלל.

מה ההבדל בין הרצה ב־768 ל־1,792 טוקנים?

המודל אומן במקור על תקציב של 768 טוקנים לעמוד, שדורש כ־179 גיביבייט למיליון דפים. העלאת הרזולוציה ל־1,792 טוקנים משפרת במעט את הדיוק אבל מקפיצה את נפח האחסון ליותר מכפול.

למה לא להשתמש בגרסה החדשה EVIE-4.5B?

המפרסמים עצמם מפנים לגרסה הרשמית שתומכת בדחיסת וקטורים יעילה יותר. הגרסה הזו מתאימה בעיקר לשחזור תוצאות המדידה הישנות או לבדיקות על בסיס התשתית הקודמת.

איך מריצים

המשקל עומד על 8.5 ג'יגה בייט בפורמט BF16, כך שכרטיס מסך בודד עם 16GB זיכרון יספיק להרצה מקומית. אפשר להריץ אותו דרך colpali-engine או דרך Sentence Transformers, אבל בריצה ישירה חובה לוודא שמפעילים קשב דו־כיווני ומאפסים את משתנה החבלים לפני כל שאילתה כדי לא לאבד דיוק.

נפח האינדקס דורש חישוב מוקדם. מיליון עמודים בתקציב הנמוך יתפסו 179.2 גיביבייט בזיכרון, ובתקציב הגבוה 420.5 גיביבייט. אם אתם מחזיקים עשרות מיליוני עמודים ואין לכם תשתית וקטורית מתאימה, תעדיפו שירות מנוהל.

pip install -U huggingface_hub
hf download tencent/EVIE-Preview-4.5B

הרישיון

הקוד והמשקלים שוחררו תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או מסחרית, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗