GPT
L

llava-v1.6-34B-gguf

קוד פתוח

cjpaisapache-2.02024-02-01

  • gguf
  • llava
  • image-text-to-text
  • endpoints_compatible
  • conversational

מודל ראייה ושפה פתוח בגודל 34 מיליארד פרמטרים בגרסת GGUF. הוא משלב יכולת פיענוח תמונות עם בסיס טקסט חזק, להרצה עצמאית בלי ענן מסחרי.

  • 227 GBמשקל הקבצים
  • 1,621הורדות בחודש
  • 42לייקים

מה זה

מדובר בגרסה מכווצת בפורמט GGUF של LLaVA 1.6, שנבנתה על בסיס מודל השפה Nous Hermes 2 Yi 34B. המודל מקבל תמונה יחד עם טקסט ומחזיר תשובה כתובה, משיחה חופשית על תוכן התמונה ועד מענה לשאלות מורכבות שמצריכות הבנה ויזואלית עמוקה.

האימון שלו נשען על שילוב של מאות אלפי זוגות תמונה וטקסט מפרויקטים כמו LAION יחד עם מידע סינתטי מבוסס GPT-4V ושיחות ממאגר ShareGPT. השילוב הזה נותן לו הבנת עולם רחבה בהרבה ממודלי ראייה קטנים של 7 או 13 מיליארד פרמטרים, במיוחד בהבנת הקשרים מורכבים בתוך תמונות.

הקובץ המקורי כבד מאוד, והמרה לפורמט הזה מאפשרת לטעון אותו ישירות דרך llama.cpp. הוא מיועד למי שחייב מודל מולטימודלי איכותי אצלו בשרת, ולא מוכן להסתמך על מודלים קטנים שנוטים לפספס פרטים בתמונות.

מתאים ל

  • ניתוח תמונות בשרת פנימי

    מאפשר תשאול תמונות ומסמכים ויזואליים בתוך הרשת המקומית ללא הוצאת מידע.

  • חילוץ מידע מדיאגרמות

    בסיס ה־34B נותן יכולת טובה לפענוח גרפים מורכבים והסבר הנתונים בטקסט.

  • בניית בוט מולטימודלי

    המודל אומן על דאטה של שיחות ויודע לענות ישירות על תמונות שמשתמש מעלה.

איפה זה נופל

המודל אומן על מידע סינתטי ואינטרנטי, ולכן הוא מייצר לעיתים הזיות על גבי תמונות, במיוחד בפרטים קטנים או בטקסט צפוף. כרטיס המודל מגדיר אותו כמיועד בעיקר למחקר ולחובבים, ולא כמוצר מוגמר לייצור. בנוסף, רמות הכיווץ הנמוכות כמו Q3 סובלות מאובדן איכות מורגש בהבנת התמונה, כך שאי אפשר להסתמך עליהן למשימות שדורשות דיוק גבוה.

שאלות
נפוצות

האם אפשר להריץ את גרסת ה־Q4 על כרטיס RTX 3090 יחיד?

כן, הקובץ שוקל 20.66 גיגה בייט ונכנס בזיכרון של 24 גיגה. עם זאת, צריך לזכור שנדרש עוד זיכרון למקרן הוויזואלי ולהקשר השיחה, אז תהיו קרובים לקצה.

למה יש כל כך הרבה קבצים בתיקייה?

היוצר יצר כיבוצים שונים ברמות דחיסה שונות, מ־3 ביט ועד 8 ביט. אתם צריכים להוריד רק קובץ אחד שמתאים לנפח הזיכרון שלכם.

איך מריצים

כדי להריץ את המודל צריך כלי תומך GGUF כמו llama.cpp עם תמיכה במקרן הוויזואלי המתאים. הגרסאות הקיימות נעות בין כיבוץ Q3 קל של 14.2 גיגה בייט ועד Q8 שדורש 36.5 גיגה בייט. קובץ Q4 ששוקל קצת מעל 20 גיגה בייט נחשב לנקודת האיזון המומלצת בין דיוק לנפח, והוא דורש כרטיס מסך עם לפחות 24 גיגה זיכרון כדי לפעול בקצב סביר.

אם אין לכם חומרה ייעודית כזו בענן או שרת מקומי חזק, המודל ייפול לזיכרון המערכת ויזחל. במצב כזה, עדיף להשתמש בנקודת קצה מסחרית דרך API מאשר לנסות להריץ 34 מיליארד פרמטרים על מעבד רגיל.

ollama run hf.co/cjpais/llava-v1.6-34B-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי קוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי. כדאי לשים לב שבכרטיס המודל יש הפניה לרישיון של מודל הבסיס של חברת NousResearch.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗