GPT
Q

Qwen2-VL-OCR-2B-Instruct

קוד פתוח

prithivMLmodsapache-2.02024-12-19

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • Math

גרסה מכווננת לחילוץ טקסט מתמונות ומסמכים ששוקלת מעט מאוד. היא מתאימה למי שרוצה להריץ פענוח תמונה מקומית בלי לתפוס שרת שלם.

  • 2.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 4.1 GBמשקל הקבצים
  • 1,497הורדות בחודש

מה זה

מדובר בהתאמה עדינה למודל הבסיס של עליבאבא בגודל 2.2 מיליארד פרמטרים, עם דגש ממוקד על קריאת טקסט ופתרון בעיות מתמטיות. במקום לנסות להיות מודל ראייה ענקי לכל מטרה, הוא מתרכז בהמרת פיקסלים לטקסט כתוב וביצירת משוואות בפורמט LaTeX. התוצאה היא כלי קל שיודע לעבד תמונות ברזולוציות שונות ומשתלב בשיחה רגילה.

היתרון שלו על פני מודלים כלליים באותו סדר גודל הוא המיקוד. המפרסם כיוון אותו ספציפית לתרחישי OCR, מסמכים וזיהוי נוסחאות, כך שהוא אמור להתמודד טוב יותר עם עמודי טקסט צפופים בלי לדרוש משאבים כבדים. חלון ההקשר של 32,768 טוקנים נותן מרחב נשימה סביר גם לתמונות מורכבות או לפלטים ארוכים.

מתאים ל

  • חילוץ משוואות ממסמכים

    הוא מזהה מבנים מתמטיים מורכבים בתוך תמונות וממיר אותם לקוד LaTeX תקין.

  • דיגיטציה של ניירת באנגלית

    מאפשר לשלוף טקסט ממסמכים סרוקים או צילומי דפים ישירות למחרוזות טקסט לעיבוד.

  • סריקה מקומית במכשיר קצה

    המשקל הקל מאפשר להריץ אותו ישירות על מחשב מקומי ללא שליחת מידע רגיש לענן.

איפה זה נופל

הנתונים הרשמיים מגדירים את המודל רק עבור השפה האנגלית. למרות שמודל הבסיס מכיר שפות נוספות, אין שום ערובה שהוא יתמודד כמו שצריך עם מסמכים בעברית, כך שתצטרכו לבדוק את זה ידנית לפני שתבנו עליו.

מעבר לזה, הכרטיס לא מציג ציוני מבחן כמותיים של הגרסה הזו מול מודל הבסיס, אלא רק מצהיר על שיפורים כלליים. קחו בחשבון שמודל של שני מיליארד פרמטרים עדיין מועד להזיות בטקסטים מטושטשים או קטנים מאוד.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים ותמונות בעברית?

מפרט המודל מציין אנגלית בלבד. מודל הבסיס כולל יכולות רב לשוניות מסוימות, אבל הכוונון הספציפי הזה לא נבדק רשמית בעברית ולכן חובה לבצע בדיקה מקדימה על דוגמאות שלכם.

איזה כרטיס מסך צריך כדי להריץ אותו באופן שוטף?

המודל שוקל מעט מעל ארבעה גיגה בייט, כך שכל מעבד גרפי עם 8 גיגה זיכרון יריץ אותו בקלות. זה הופך אותו לנגיש מאוד על חומרה ביתית פשוטה בלי צורך בתשתיות ענן יקרות.

איך מריצים

בזכות משקל של 4.1 גיגה בייט בפורמט bfloat16, המודל נכנס בלי בעיה לכרטיס מסך ביתי בודד עם 6 עד 8 גיגה זיכרון. מריצים אותו ישירות דרך ספריית transformers הרגילה של פייתון, ויש גם מחברת קולאב מוכנה שמאפשרת לבדוק אותו תוך דקות.

אם אתם צריכים לנתח רק עמוד בודד מדי פעם, עדיף לפנות ל־API חיצוני של מודל ענן גדול במקום לתחזק שרת. לעומת זאת, כשיש זרם קבוע של מסמכים או כשחייבים שהמידע לא ייצא מהרשת המקומית, הגודל הזה הופך את ההרצה העצמאית למאוד זולה והגיונית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="prithivMLmods/Qwen2-VL-OCR-2B-Instruct")
print(pipe("שלום"))

הקבצים

52 קבצים במאגר, 4.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ ברישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗