GPT
M

MiniCPM-V-4.6-gguf

קוד פתוח

openbmbapache-2.02026-05-08

  • transformers
  • gguf
  • minicpm-v
  • multimodal
  • On-Device Model

מודל ראייה ושפה קומפקטי שמיועד לרוץ מקומית על טלפונים וכרטיסי מסך ביתיים. אתם מקבלים עיבוד תמונות ווידאו בלי לשלם על שרתים יקרים או לוותר על ביצועים סבירים.

  • 7.9 GBמשקל הקבצים
  • 20,611הורדות בחודש
  • 75לייקים

מה זה

בבסיס שלו יושבים מקודד תמונה SigLIP2-400M ומודל שפה Qwen3.5-0.8B. השילוב הזה נותן ניתוח של תמונה בודדת, רצף תמונות וסרטוני וידאו. השינוי המרכזי מגרסאות קודמות הוא דחיסת טוקנים ויזואליים ביחס של 4x או 16x לפי הצורך, מה שחותך את חישובי הקידוד בחצי ומאיץ את קצב פליטת הטוקנים פי 1.5 לעומת מודל הבסיס.

במדד Artificial Analysis Intelligence Index המודל קיבל ציון 13, שעוקף את Qwen3.5-0.8B וגם מודלים גדולים יותר כמו Ministral 3 3B. המבחנים מראים ביצועים שמקבילים למודלים של 2B במשימות זיהוי טקסט מתמונה, איתור עצמים והבנת הקשר ויזואלי, אבל עם צריכת משאבים של מודל קטן בהרבה.

מתאים ל

  • אפליקציות מובייל מקומיות

    הוא מיועד מראש להתקנה על טלפונים לניתוח תמונות ומסמכים במכשיר, ללא תלות ברשת.

  • ניתוח מסמכים ותוויות

    ציונים חזקים בבדיקות זיהוי תווים מאפשרים לחלץ טקסט מתמונות קבלות וכרטיסים במשאבים מינימליים.

  • סריקת קטעי וידאו קצרים

    תמיכה מובנית בדגימת פריימים גמישה מאפשרת לעבד סרטונים שלמים בלי לפוצץ את זיכרון ה־VRAM.

איפה זה נופל

המודל נוטה לפלוט לפעמים את התו שבירת שורה כמחרוזת גולמית במקום לרדת שורה בפועל, מה שמחייב אתכם להוסיף קוד ניקוי בביטויים רגולריים בצד הלקוח. בקריאות לכלים ולפונקציות אין עדיין תמיכה מובנית בספריה הראשית, והתשובה המובנית חוזרת כטקסט עם תגיות שצריך לפרק ידנית. בנוסף, פענוח וידאו דורש תלויות ספציפיות שלא תמיד עובדות חלק עם גרסאות שונות של CUDA ומאלצות מעבר לחבילות חלופיות כמו PyAV.

אותה משפחה

MiniCPM-V-4.6 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בהפעלת פונקציות וכלים חיצוניים?

כן, הוא מייצר בלוק של קריאה לפונקציה, אבל בספריית transformers אין מפענח רשמי למבנה הזה. תצטרכו לחלץ את שם הפונקציה והפרמטרים בעזרת ביטוי רגולרי בעצמכם, או להשתמש בשרת vLLM עם מפענח מתאים.

איך שולטים בפשרה בין איכות התמונה למהירות הריצה?

בהגדרות השיחה מעבירים את המשתנה downsample_mode לערך 16x למהירות מרבית, או 4x כדי לשמור על פרטים עדינים בתמונה על חשבון תוספת זמן חישוב.

מה צריך להתקין כדי לנתח וידאו בלי תקלות סביבה?

ספריית torchcodec עלולה להיכשל מול גרסאות CUDA מסוימות. הפתרון הישיר שהמפתחים מציעים הוא להתקין את ספריית PyAV במקומה, והיא תטפל בפענוח הווידאו בלי תלות בסביבת הדרייבר.

איך מריצים

הגרסה הזו ארוזה בקובצי GGUF, כך שאפשר להריץ אותה ישירות דרך llama.cpp עם הפקודה llama-server, או דרך Ollama על מחשב אישי וכרטיס מסך פשוט. הוא נתמך גם במנועים כמו vLLM ו־SGLang לפריסה מקומית על שרת, וכולל קוד פתוח ייעודי להתקנה ישירה על מכשירי iOS, אנדרואיד ו־HarmonyOS.

המפרסמים שחררו גם שירות ענן עם מפתח ציבורי חינמי, אז אם אתם רק בודקים היתכנות של פרויקט, חבל להגדיר סביבה מקומית לפני שבדקתם את התוצאות מול השרת שלהם.

ollama run hf.co/openbmb/MiniCPM-V-4.6-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או חיצונית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗