GPT
L

llava-phi-3-mini-gguf

קוד פתוח

xtunerרישיון לא דווח2024-04-25

  • gguf
  • image-to-text
  • endpoints_compatible
  • conversational

מודל ראייה ושפה קומפקטי שמחבר את פיי 3 מיני עם מקודד תמונה של קליפ. הוא מיועד למי שרוצה ניתוח תמונות מקומי בלי לטחון זיכרון ובלי להחזיק מודלי ענק.

  • 9.8 GBמשקל הקבצים
  • 1,409הורדות בחודש
  • 140לייקים

מה זה

הפרויקט הזה לוקח את המודל הקטן של מיקרוסופט, Phi-3-mini-4k-instruct, ומחבר אותו למקודד הוויזואלי CLIP-ViT-Large ברזולוציה של 336 פיקסלים. החיבור והאימון נעשו באמצעות הכלי של XTuner על גבי מערכי נתונים כמו ShareGPT4V ו־InternVL. בגלל שמדובר בגרסת GGUF, המטרה הברורה כאן היא לאפשר ריצה חלקה על חומרה צנועה.

במבחני הביצועים הוא עוקף לפעמים גם מודלים מבוססי לאמה 3 של שמונה מיליארד פרמטרים. במבחן MMMU שמודד הבנה מולטימודלית ברמה אקדמית הוא הגיע לציון של 41.4 לעומת 37.1 של לאמה 3, ובמבחן ההזיות של HallusionBench הוא קיבל 49.8. עם זאת, במשימות של קריאת טקסט מתוך תמונה כמו TextVQA הוא קיבל 57.8, תוצאה נמוכה במעט מהמתחרים, מה שמראה שהכוח שלו הוא בהבנת סצנות ולא בפענוח מסמכים צפופים.

מתאים ל

  • תיאור תמונות פשוטות אופליין

    זיהוי אובייקטים והבנת סצנה כללית בלי להוציא מידע לרשת ובלי צורך בכרטיס מסך מפלצתי.

  • עוזר מקומי על מחשב נייד

    גרסת ה־int4 רצה דרך Ollama או llama.cpp בצריכת זיכרון מינימלית.

  • מענה על שאלות מדעיות

    מציג ציון של 73.7 במבחן ScienceQA, גבוה יותר ממודלי ראייה אחרים בסדר הגודל הזה.

איפה זה נופל

החולשה העיקרית נמצאת ברזולוציית הקלט, שמוגבלת ל־336 על 336 פיקסלים בלבד. זה אומר שתמונות עם פרטים קטנים, טבלאות עמוסות או פונטים זעירים מאבדות מידע קריטי עוד לפני שלב העיבוד, כפי שמשתקף בציון הנמוך יחסית במבחן TextVQA. בנוסף, חלון ההקשר מוגבל ל־4k טוקנים לפי תבנית השיחה של Phi-3-instruct, ולכן אי אפשר לנהל איתו שיחות ממושכות ועמוסות בתמונות בלי לאבד את ההקשר.

אותה משפחה

llava-phi-3-mini יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל ישירות בתוך Ollama?

כן, המאגר מספק קובצי Modelfile מוכנים גם לגרסת ה־f16 וגם לגרסת ה־int4. יוצרים את המודל בפקודת ollama create ומריצים מול תמונה ישירות מהטרמינל.

למה צריך שני קבצים שונים כדי לעבד תמונה?

בארכיטקטורה של LLaVA תחת llama.cpp, עיבוד התמונה נעשה באמצעות קובץ mmproj נפרד שממיר את התמונה לטוקנים, ואילו מודל השפה הראשי מייצר את התשובה הטקסטואלית.

איך מריצים

כדי להריץ אותו צריך להוריד שני קבצים נפרדים, את מודל השפה עצמו ואת מקרן הראייה mmproj בקובץ f16. יש שתי גרסאות שפה עיקריות, אחת ברמת דיוק מלאה של f16 ואחת מכווצת ב־int4 שמתאימה גם למחשבים ניידים עם מעט זיכרון עבודה. הריצה מתבצעת ישירות דרך פקודת llava-cli של llama.cpp עם חלון הקשר של 4096, או דרך יצירת מודל מותאם ב־Ollama בעזרת קובצי ה־Modelfile שסופקו במאגר.

אם אתם צריכים לנתח אלפי תמונות בדקה או שאתם מחפשים קריאת מסמכים מורכבים ב־OCR, שווה לשלם על API חיצוני חזק. המודל הזה מתאים כשחייבים פרטיות מוחלטת, ריצה אופליין או חיסכון בעלויות שרת קבוע.

ollama run hf.co/xtuner/llava-phi-3-mini-gguf:llava-phi-3-mini-int4

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

היוצרים לא ציינו רישיון בקובצי המאגר. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר פונה לקוחות חושף אתכם לסיכון משפטי עד שהמפתחים יעדכנו תנאי הפצה ברורים.

הרישיון המלא בעמוד המודל ↗