GPT
M

MiniCPM-V-2

קוד פתוח

openbmbרישיון לא דווח2024-04-09

  • transformers
  • safetensors
  • minicpmv
  • feature-extraction
  • visual-question-answering

מודל ראייה ושפה קומפקטי שמיועד לפעול ישירות על מחשבים אישיים או מכשירי קצה. הוא מצטיין בפענוח טקסט מתמונות ומציג עמידות גבוהה להזיות ביחס לגודלו.

  • 3.4Bפרמטרים
  • 4,096טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 40,868הורדות בחודש

מה זה

מדובר במודל רב־מודאלי בגודל 3.4 מיליארד פרמטרים שמשלב את מודל השפה MiniCPM-2.4B עם רכיב הראייה SigLip-400M דרך perceiver resampler. השילוב הזה מכווץ את ייצוג התמונה לפחות טוקנים, מה שחוסך זיכרון ומאפשר לו לנתח תמונות ברזולוציה של 1.8 מיליון פיקסלים בכל יחס תמונה בלי לחנוק את החומרה.

במבחני ביצועים הוא עוקף מודלים פתוחים כבדים בהרבה כמו Yi-VL 34B ו־Qwen-VL-Chat 9.6B בלוח התוצאות של OpenCompass. החוזק הבולט שלו הוא פענוח טקסט בתוך תמונות, תחום שבו היוצרים מדווחים על תוצאות שמשתוות ל־Gemini Pro במבחני OCRBench ו־TextVQA. בנוסף, הוא אומן באמצעות RLHF-V כדי לצמצם תופעות של המצאת פרטים שלא קיימים בתמונה, ומגיע לרמה של GPT-4V במבחן Object HalBench.

מתאים ל

  • קריאת שלטים ותפריטים

    המודל מציג ביצועי OCR חזקים במיוחד ויודע לקרוא טקסט מורכב מתמונות ברזולוציה גבוהה.

  • הטמעה באפליקציית מובייל

    בזכות משקל של 6.4 גיגה ודחיסת טוקנים יעילה, הוא רץ ישירות על מכשירי אנדרואיד ללא שרת.

  • תיאור תמונות ללא הזיות

    שילוב שיטת RLHF-V מקטין משמעותית המצאת עצמים שלא קיימים בתמונה ביחס למודלים קטנים.

איפה זה נופל

התמיכה הלשונית של המודל מוגבלת רשמית לאנגלית ולסינית בלבד. אין לו תמיכה מוצהרת בעברית, ולכן ניתוח מסמכים מקומיים או דו־שיח בעברית כנראה ייכשלו או ייצרו פלט משובש לחלוטין.

חלון ההקשר מוגבל ל־4,096 טוקנים, מה שמגביל הזנה של תמונות מרובות יחד עם טקסט ארוך. למרות אימוני ה־RLHF, המפתחים מבהירים במפורש שהמודל נוטה לפעמים לייצר שגיאות ולחזות טקסט שגוי, ואינו מחליף בדיקה אנושית.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל אומן ותומך רשמית באנגלית ובסינית בלבד. ניסיון לפענח שלטים בעברית או לשאול שאלות בעברית יוביל לתוצאות גרועות.

באיזו חומרה מינימלית אפשר להריץ אותו?

המשקלים תופסים 6.4 גיגה־בייט. כרטיס מסך עם 8 גיגה זיכרון וידאו יספיק להרצה בסיסית, וניתן להריץ אותו גם על מחשבי מק או טלפונים ניידים נתמכים.

מה היתרון של המודל על פני LLaVA רגיל?

הוא תומך ברזולוציות של עד 1.8 מיליון פיקסלים בכל יחס תמונה, משתמש בפחות טוקנים לתמונה ומציג עמידות גבוהה יותר להזיות.

איך מריצים

המשקל הכולל של הקבצים עומד על 6.4 גיגה־בייט בפורמט bfloat16, כך שאפשר להריץ אותו בנוחות על כרטיס מסך בודד עם 8 עד 12 גיגה זיכרון, במחשבי מק עם מעבדי אפל, ואפילו ישירות על טלפונים ניידים מבוססי אנדרואיד. המודל נתמך בספריית transformers וקיים עבורו פיצול ייעודי של vLLM להאצת השרתים.

אם אתם צריכים רק מענה לשאלות על תמונות בענן ובנפח נמוך, שירותי צד שלישי עשויים לחסוך תחזוקה. ההרצה העצמית משתלמת במיוחד כשרוצים עיבוד מקומי מוחלט, שמירה על פרטיות התמונות, או הטמעה ישירה על מכשירי קצה.

from transformers import pipeline

pipe = pipeline("visual-question-answering", model="openbmb/MiniCPM-V-2")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת רישיון Apache-2.0, אך קובצי המשקולות כפופים לרישיון קנייני של MiniCPM. מחקר אקדמי חופשי לחלוטין. שימוש מסחרי מותר בחינם, אך מחייב מילוי טופס רישום מקוון מול החברה לפני ההפצה.

הרישיון המלא בעמוד המודל ↗