GPT
V

Vintern-1B-v3_5

קוד פתוח

5CD-AImit2025-01-11

  • transformers
  • safetensors
  • internvl_chat
  • feature-extraction
  • image-text-to-text

זה מודל ראייה ושפה קטן שמיועד ספציפית לניתוח מסמכים וטקסט בווייטנאמית. מי שצריך חילוץ מידע מתמונות בשפה הזו בחומרה בסיסית ימצא בו פתרון ממוקד.

  • 938Mפרמטרים
  • 3.5 GBמשקל הקבצים
  • 6,991הורדות בחודש
  • 125לייקים

מה זה

מדובר במודל מולטימודלי בגודל 938 מיליון פרמטרים, המבוסס על InternVL2.5-1B ועבר אימון נוסף על נתונים רבים בווייטנאמית. המטרה העיקרית שלו היא זיהוי תווים, הבנת מסמכים סרוקים, חשבוניות, כתב יד וטבלאות, תחום שבו מודלים קטנים כלליים מתקשים לעיתים קרובות.

תוצאות המדידה מציגות תמונה ברורה לגבי הפשרות שנעשו כאן. במבחן vi-MTVQA הממוקד בווייטנאמית הוא מגיע לציון 41.9 לעומת 24.8 במודל הבסיס ו־37.4 בגרסה הקודמת שלו, מה שמראה שיפור ישיר בשפה שלשמה הוא נוצר. לעומת זאת, במבחנים כלליים באנגלית כמו DocVQA, InfoVQA ו־OCRBench הוא מפסיד למודל הבסיס המקורי. השיפור מגרסה v2 מובהק כמעט בכל מדד, כולל קפיצה ב־ChartQA מ־34.1 ל־65.7, אבל ההתאמה לשוק הווייטנאמי דרשה מחיר ביכולות הכלליות.

מתאים ל

  • OCR למסמכים בווייטנאמית

    חילוץ טקסט מחשבוניות, חוזים וטבלאות בווייטנאמית במערכות מקומיות.

  • הרצה מקומית על מעבד

    עיבוד תמונות ושאילתות על מכשירי קצה חלשים באמצעות התאמת llama.cpp.

  • כוונון למסמכים ייעודיים

    אימון נוסף על פורמטים ספציפיים בעלויות מחשוב נמוכות הודות לגודל המודל.

איפה זה נופל

החיסרון הברור ביותר הוא השפה. המודל מתמקד בווייטנאמית, אנגלית וסינית, ואין בו שום התאמה או תמיכה בעברית. אם תנסו לנתח איתו מסמך ישראלי, התוצאות יהיו בלתי שמישות.

מעבר לזה, מודל הבסיס InternVL2.5 עוקף אותו במבחני OCR וגרפים כלליים באנגלית, כך שאם הדאטה שלכם לא מכיל וייטנאמית, אין שום סיבה טכנית להעדיף את הגרסה הזו על פני מודל המקור.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לקריאת חשבוניות בעברית?

לא. המודל לא אומן על עברית ולא מיועד לכך. השפות המוגדרות בו הן וייטנאמית, אנגלית וסינית בלבד, והוא ייכשל בזיהוי תווים מקומיים.

למה לבחור בו במקום במודל הבסיס InternVL2.5-1B?

הסיבה היחידה לבחור בו היא אם המידע שלכם כולל טקסט בווייטנאמית. במבחנים באנגלית מודל הבסיס מציג ציונים גבוהים יותר ברוב המדדים, כולל ב־DocVQA וב־OCRBench.

איזו חומרה צריך בשביל להריץ אותו בפועל?

הוא רץ בלי בעיה על מעבד רגיל של מחשב נייד באמצעות llama.cpp, או על כרטיס גרפי חינמי ברמת T4. המשקל של הקבצים הוא 3.5 גיגה בייט בלבד.

איך מריצים

המודל שוקל 3.5 גיגה בייט ומסוגל לרוץ על כרטיס גרפי פשוט כמו T4 של גוגל קולאב, או על מעבד רגיל בזמן אמת באמצעות llama.cpp. הוא זמין דרך ספריית transformers הרגילה של פייתון, ויש לו מחברות עבודה מוכנות להרצה ולאימון נוסף.

אם אתם צריכים רק לחלץ כמה חשבוניות בחודש, מודל כזה ידרוש מכם תחזוקה שלא בטוח ששווה את הטרחה מול פנייה ל־API קיים. הוא נהיה רלוונטי כשצריך לעבד כמויות גדולות של מסמכים מקומיים בלי עלות קריאה פר תמונה, או כשרצים בסביבה מנותקת רשת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="5CD-AI/Vintern-1B-v3_5")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים והפצה מחדש בתוך מוצר סגור או פתוח, כשהדרישה היחידה היא שמירה על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗