GPT
M

MiniCPM-Llama3-V-2_5

קוד פתוח

openbmbרישיון לא דווח2024-05-19

  • transformers
  • safetensors
  • minicpmv
  • feature-extraction
  • minicpm-v

חיבור של Llama 3 ורכיב ראייה שמספק יכולות ניתוח תמונה וטקסט ברמה גבוהה. מתאים למי שרוצה חילוץ נתונים ויזואליים מדויק מקומית בלי לשלוח מידע לענן.

  • 8.5Bפרמטרים
  • 8,192טוקנים בהקשר
  • 16.0 GBמשקל הקבצים
  • 15,788הורדות בחודש

מה זה

הפיתוח מחבר בין בסיס השפה של Llama3-8B לבין מקודד הראייה SigLip-400M כדי ליצור מודל רב מודלי של 8.5 מיליארד פרמטרים. המטרה המרכזית כאן היא הבנת מסמכים ותמונות ברמת פירוט גבוהה, כולל תמיכה בתמונות עד 1.8 מיליון פיקסלים ביחסי גובה רוחב משתנים.

במבחני OCRBench המודל עבר את ציון 700, מה שמציב אותו מעל מערכות קנייניות גדולות בחילוץ טקסט מתמונות, קריאת טבלאות והמרתן למבנה מרקדאון. בנוסף, המפתחים מדווחים על ציון של 65.1 במדד OpenCompass ושיעור הזיות של 10.3 אחוזים במבחן HalBench בזכות אימון מבוסס RLAIF-V.

הוא תומך ביותר מ־30 שפות ומיועד לתת מענה מקומי למשימות שדורשות שילוב בין קריאת מסמכים לבין ניתוח לוגי, בלי התקורות של מודלי ענק.

מתאים ל

  • המרת טבלאות למרקדאון

    מפענח טבלאות מורכבות מתמונות ומסמכים וממיר אותן ישירות לטקסט מובנה.

  • חילוץ טקסט מצילומים

    מתאים ל־OCR בתנאי צילום משתנים וברזולוציות של עד 1.8 מיליון פיקסלים.

  • הרצה מקומית על קצה

    עובד בפורמט int4 ו־GGUF על מעבדים וכרטיסים צנועים עם 8GB זיכרון.

איפה זה נופל

למרות השליטה ביותר מ־30 שפות, הכרטיס מציין במפורש רק אנגלית וסינית כשפות בסיס שנבדקו לעומק, ולכן איכות העבודה בעברית אינה מובטחת ודורשת בדיקה מקדימה. הרזולוציה המקסימלית מוגבלת ל־1.8 מיליון פיקסלים, כך שמסמכים צפופים מאוד או שרטוטים הנדסיים מורכבים עלולים לאבד פרטים קריטיים. המפתחים מדגישים שהמודל אינו מפעיל שיפוט ערכי או הבנה אמיתית, והוא נוטה לייצר שגיאות שעלולות לדרוש אימות אנושי קבוע לפני שימוש באוטומציות.

אותה משפחה

MiniCPM-Llama3-V-2-5 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לשימוש באפליקציה מסחרית?

כן, אך זה מותנה ברישום. משקלי המודל דורשים מילוי טופס ייעודי מול המפתחים לקבלת אישור מסחרי חינמי, בעוד הקוד עצמו זמין תחת Apache 2.0.

האם הוא מסוגל לעבד מסמכים ארוכים?

חלון ההקשר מוגבל ל־8,192 טוקנים והוא מטפל בתמונה בודדת ברזולוציה של עד 1344 על 1344 פיקסלים. לעיבוד חוברות עבות או ספרי מסמכים שלמים תצטרכו לחתוך את הקובץ לעמודים בודדים.

איך מריצים

כדי להריץ את גרסת ה־float16 המקורית דרך transformers תצטרכו כרטיס מסך עם לפחות 20GB זיכרון ייעודי, או שני כרטיסי V100 אם אתם מתכננים לעשות כוונון עדין ב־LoRA. הקבצים שוקלים 16.0GB, כך שנדרשת תשתית שרתים סטנדרטית.

אם רוצים לחסוך בחומרה, קיימת גרסת int4 שמסתפקת ב־8GB זיכרון כרטיס מסך, וכן תמיכה ישירה ב־llama.cpp עם קובצי GGUF להרצה על מעבדים מקומיים. כשיש צורך בעומסי עבודה גבוהים ללא ניהול שרתים, פנייה ל־API קנייני תהיה פשוטה יותר מאשר לתחזק אשכול vLLM עצמאי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="openbmb/MiniCPM-Llama3-V-2_5")
print(pipe("שלום"))

הרישיון

הקוד עצמו מופץ תחת רישיון Apache 2.0, אך משקלי המודל כפופים לרישיון נפרד של MiniCPM. מחקר אקדמי חופשי לחלוטין, אך שימוש מסחרי מחייב מילוי טופס שאלון מקוון ורישום מול החברה כדי לקבל אישור חינמי.

הרישיון המלא בעמוד המודל ↗