GPT
M

MiniCPM-V-2_6-gguf

קוד פתוח

openbmbרישיון לא דווח2024-08-04

  • gguf
  • endpoints_compatible
  • conversational

גרסת GGUF של מודל ראייה ושפה קומפקטי שמיועדת להרצה מקומית דרך llama.cpp. היא מתאימה למי שרוצה לפענח תמונות על המחשב בלי לשלוח מידע החוצה.

  • 110 GBמשקל הקבצים
  • 11,589הורדות בחודש
  • 180לייקים

מה זה

המאגר כולל קבצים בפורמט GGUF עבור MiniCPM-V 2.6, מודל מולטימודלי שמסוגל לקבל תמונה וטקסט ולהחזיר תשובה. ההמרה לפורמט הזה נועדה לחסוך התעסקות עם סביבות פייתון כבדות, ומאפשרת להריץ עיבוד תמונה ושיחה ישירות על גבי מעבדים רגילים או כרטיסי מסך צנועים בעזרת פרויקט llama.cpp.

המפרסמים סיפקו כאן את הקבצים המוכנים לצד סקריפטים להמרה וכימות עצמאיים ממודל הפייטורץ' המקורי. המודל מתמקד במענה על שאלות סביב תמונות, ניתוח תוכן חזותי וניהול שיחה אינטראקטיבית על בסיס קלט ויזואלי, תוך שימוש ברכיב הקרנה ייעודי שמחבר בין מעבד התמונה למודל השפה. משקל כלל הקבצים בעמוד מגיע ל־110 גיגה בייט מפני שהוא מכיל 26 קבצים, שכוללים כנראה רמות כימות שונות, ולא קובץ בודד שצריך להוריד במלואו.

מתאים ל

  • ניתוח תמונות אופליין

    הרצה מקומית על לינוקס או מק ללא צורך בחיבור רשת או הוצאת מידע רגיש.

  • תשאול אינטראקטיבי על תמונה

    תמיכה מובנית במצב שיחה מתמשך סביב קובץ תמונה באמצעות שורת הפקודה.

  • בדיקת איכות כימות לקלט ויזואלי

    זמינות סקריפטים להמרה עצמאית לפורמט int4 מאפשרת לבחון פשרות בין גודל לדיוק.

איפה זה נופל

החיסרון הבולט הוא התלות בגרסת קוד נפרדת ולא ממוזגת של llama.cpp, מה שאומר שעדכונים עתידיים עלולים לשבור תאימות ולדרוש תחזוקה ידנית. מעבר לזה, הכרטיס אינו מציג מדדי ביצועים, זמני תגובה או נתונים על דיוק בניתוח טקסט עברי בתוך תמונות, ולכן חובה לבדוק אותו מקומית לפני שילוב בתהליך עבודה קריטי.

אותה משפחה

MiniCPM-V-2-6 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל 110 הגיגה בייט של המאגר?

לא. המאגר מכיל 26 קבצים שונים של גרסאות וחלקי מודל. בפועל מורידים רק את רמת הכימות שרוצים להריץ, כמו Q4_K_M, יחד עם קובץ ה־mmproj המתאים.

האם אפשר להריץ אותו עם הגרסה הרשמית והרגילה של llama.cpp?

לפי ההנחיות בכרטיס המודל, יש צורך לשכפל ענף ייעודי בשם minicpmv-main ממאגר הקוד של OpenBMB ולקמפל כלי ייעודי בשם llama-minicpmv-cli כדי שהעיבוד המולטימודלי יעבוד.

איך מריצים

כדי להריץ אותו צריך להשתמש בפיצול ייעודי של llama.cpp שפותח עבור הדגם הזה, לקמפל את הכלי llama-minicpmv-cli, ולהוריד את משקלי המודל יחד עם קובץ ה־mmproj המתאים לעיבוד תמונה. הפקודה כוללת הפניה לקובץ המשקלים, לקובץ הפרוג'קטור, לתמונה עצמה ולחלון הקשר של 4096 טוקנים.

בכרטיס מוצגת הרצה בפורמט f16 מלא שדורש משאבים כבדים, לצד גרסת Q4_K_M מכומתת שחוסכת המון זיכרון ומתאימה למחשבי לינוקס או מק מודרניים. אם אין לכם מעבד גרפי סביר או זיכרון פנוי, או אם אתם לא רוצים להסתבך עם קומפילציה ידנית של גרסת קוד ספציפית, עדיף להשתמש ב־API מרוחק.

ollama run hf.co/openbmb/MiniCPM-V-2_6-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בעמוד המודל לא דווח רישיון כלל. המשמעות היא שאין הרשאה ברורה ומפורשת לשימוש מסחרי או להפצה חוזרת של הקבצים האלה, ולפני שמכניסים אותו למוצר עסקי יש לבדוק את הרישיון המקורי של משקלי הפייטורץ' כדי לא להסתכן בהפרת זכויות.

הרישיון המלא בעמוד המודל ↗