GPT
L

llava-v1.6-34b-hf

קוד פתוח

llava-hfרישיון לא דווח2024-03-17

  • transformers
  • safetensors
  • llava_next
  • image-text-to-text
  • vision

זה מודל ראייה ושפה גדול שמחבר בין מקודד תמונה למודל שפה של 35 מיליארד פרמטרים. בוחרים בו כשצריכים יכולות ניתוח תמונה, חילוץ טקסט והסקה ברמה גבוהה יותר מגרסאות 7B הרגילות.

  • 35Bפרמטרים
  • 4,096טוקנים בהקשר
  • 64.7 GBמשקל הקבצים
  • 9,802הורדות בחודש

מה זה

הארכיטקטורה כאן מחברת מקודד ויזואלי ישירות אל מודל השפה Nous-Hermes-2-Yi-34B. השילוב הזה, שמוכר גם בתור LLaVA 1.6, מביא תמיכה ברזולוציית תמונה גבוהה ודינמית. הוא אומן על סט נתונים מגוון יותר שמכוון ישירות לשיפור קריאת טקסט מתוך תמונות ולהסקת מסקנות מבוססת הגיון בריא.

בניגוד לגרסאות מוקדמות או קטנות יותר שמבוססות על מודלים של 7 מיליארד פרמטרים, הבסיס כאן שוקל קרוב ל־35 מיליארד פרמטרים. המשמעות היא יכולת ניסוח והבנה עמוקה בהרבה של שאלות מורכבות על גבי תמונות, שיחה רב שלבית וזיהוי פרטים קטנים, כל עוד השיחה והתוכן מתנהלים באנגלית.

מתאים ל

  • חילוץ טקסט מתמונות מורכבות

    הרזולוציה הדינמית ויכולות ה־OCR המשופרות מאפשרות לו לקרוא תוויות ודיאגרמות באנגלית בדיוק גבוה.

  • מענה על שאלות חזותיות

    בסיס השפה של 35 מיליארד פרמטרים מנתח סצנות מורכבות ומספק תשובות מנומקות במקום תיאורים שטחיים.

  • צ'אטבוט רב מודלי מתקדם

    התאמה טובה לניהול דיאלוג שמערבב תמונות וטקסט באנגלית, כל עוד השיחה לא חורגת מתקרת הטוקנים.

איפה זה נופל

חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, וזה צוואר בקבוק אמיתי. תמונות ברזולוציה גבוהה תופסות כמות נכבדה של טוקנים בעצמן, כך שלא נשאר הרבה מקום להיסטוריית שיחה ארוכה או להוראות מערכת מורכבות.

המודל אומן ומוגדר רשמית לאנגלית בלבד. אל תצפו ממנו לקרוא עברית מתוך שלטים ומסמכים או לענות בעברית תקינה בלי שבירות. מעבר לזה, צוות הפיתוח המקורי אפילו לא טרח לכתוב כרטיס מודל מלא עבור הגרסה הזו ואנשי Hugging Face מילאו את הפרטים, מה שאומר שאין נתוני ביצועים רשמיים מלאים על בדיקות קצה.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל מוגדר רשמית לשפה האנגלית בלבד. הוא לא עבר אופטימיזציה לזיהוי טקסט עברי בתמונות ולא נועד לייצר שיחה בעברית, ולכן עבור שימוש מקומי בישראל הוא יתקשה מאוד.

איך אפשר לצמצם את דרישות החומרה הגבוהות?

אפשר לטעון אותו בעזרת ספריית bitsandbytes בפורמט של 4 ביט ישירות דרך קוד ההרצה. זה מקצץ את נפח הזיכרון הגרפי הנדרש מכ־70GB לאזור ה־20-24GB ומאפשר הרצה על כרטיסים צרכניים חזקים.

מה היתרון של גרסת ה־34B על פני דגמים קטנים יותר במשפחה?

היתרון מתבטא ביכולת הסקה והבנת עולם טובה יותר בזכות מודל השפה הגדול. הוא מבין תרשימים וקשרים לוגיים בתוך התמונה ברמה שדגמי 7B נוטים לפספס.

איך מריצים

כדי להריץ אותו בדיוק float16 מקורי צריך להוריד 64.7 ג'יגה בייט של קבצים ולהחזיק לפחות 80GB של זיכרון גרפי, כלומר כרטיס A100 או שני כרטיסי תשתית רציניים. אפשרות מעשית יותר היא להשתמש בקוונטיזציה של 4 ביט עם ספריית bitsandbytes וחיבור של Flash-Attention 2, מה שמאפשר לדחוס אותו לחומרה צנועה יותר עם כרטיס בודד של 24GB או 48GB.

אם אין לכם שרת ייעודי כזה פועל ברקע, העלות והסרבול של הרמת תשתית כבדה כל כך רק בשביל כמה קריאות ביום פשוט לא שווים את המאמץ, ועדיף להשתמש בפתרון מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/llava-v1.6-34b-hf")
print(pipe("שלום"))

הרישיון

בדף המודל הרשמי לא מופיע רישיון בכלל. אף על פי שכרטיס המודל מציין שהבסיס נבחר בגלל רישוי מסחרי נוח יותר, היעדר שדה רישיון מוגדר הופך הטמעה שלו במוצר מסחרי לסיכון משפטי לא קטן, ודורש בדיקה מעמיקה של תנאי השימוש של דגם הבסיס לפני שמפיצים אותו.

הרישיון המלא בעמוד המודל ↗