GPT
N

nanoLLaVA

קוד פתוח

qnguyen3apache-2.02024-04-04

  • transformers
  • safetensors
  • llava-qwen2
  • text-generation
  • llava

מודל ראייה ושפה ששוקל ג'יגה בודד של פרמטרים ומיועד למכשירי קצה. הוא משלב בסיס טקסט של חצי מיליארד עם מקודד תמונה כדי לנתח צילומים מקומית בלי לפשוט רגל בחומרה.

  • 1.1Bפרמטרים
  • 32,768טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 10,633הורדות בחודש

מה זה

החיבור פה מבוסס על שילוב בין מקודד התמונה SigLIP של גוגל לבין מודל שפה זעיר בשם Quyen שמבוסס על Qwen1.5. יחד הם מייצרים ארכיטקטורת Llava של 1.1 מיליארד פרמטרים, כשהמטרה היא לאפשר פיענוח תמונה בסיסי ושיחה על גבי מכשירים חלשים.

התוצאות במבחנים מראות בדיוק איפה הוא עומד. ציון של 84.1 בבדיקת הזיות POPE וציון של 70.84 ב־VQA v2 אומרים שהוא יודע לזהות אובייקטים ולענות על שאלות ישירות לגביהם. מצד שני, ציונים כמו 28.6 ב־MMMU או 23.9 ב־MM-VET מבהירים שאין כאן יכולת הסקה מורכבת או הבנה מתמטית ומדעית עמוקה.

מתאים ל

  • זיהוי פשוט במכשירי קצה

    משקל קבצים של שני ג'יגה מאפשר להריץ פיענוח תמונה מקומי על חומרה חלשה בלי חיבור לרשת.

  • תיוג תמונות בסיסי

    התוצאה במבחן POPE טובה יחסית לגודל ועוזרת לוודא אילו עצמים נמצאים בתמונה ואילו לא.

  • פרוטוטייפ מקומי לראייה

    עולה בשניות בתוך סקריפט פייתון עם transformers, בלי לשלם על קריאות שרת חיצוניות בזמן פיתוח.

איפה זה נופל

היוצר עצמו מציין כבר בראש העמוד שגרסה 1.5 שלו כבר יצאה ומציגה ביצועים טובים בהרבה, מה שהופך את הגרסה הזו למיושנת מראש. נתוני האימון וקוד הפיין טיונינג לא פורסמו בכרטיס, והשפה היחידה שמוגדרת רשמית היא אנגלית, כך שאין מה לבנות עליו לעברית. בנוסף, חלון ההקשר מוגבל, ציון ה־TextVQA עומד על 46.71 בלבד מה שמעיד על קושי בקריאת טקסטים מתוך תמונה, ורמת ההסקה הכללית נמוכה מאוד בגלל מודל שפה של חצי מיליארד פרמטרים.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מגדיר תמיכה באנגלית בלבד. מודל הטקסט שעליו הוא בנוי קטן מאוד, כך שלא כדאי לבנות על יכולת מענה או הבנה של פרומפטים בעברית.

למה להוריד את הגרסה הזו ולא את החדשה יותר?

אין סיבה אמיתית. היוצר עצמו ממליץ בכרטיס לעבור לגרסה 1.5 ומציין שהיא מציגה ביצועים משופרים משמעותית.

איך כותבים לו את הפרומפט?

הוא עובד בתבנית ChatML אבל עם דרישה ספציפית בלי ירידת שורה בסוף תגית הסגירה im_end. התמונה מועברת כחלק מהטקסט תחת תגית ייעודית של image.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers הרגילה של פייתון, יחד עם accelerate ומומלץ גם flash-attn כדי לייעל את הריצה. קבצי המודל שוקלים 2.0 ג'יגה בייט בפורמט bfloat16, כך שכרטיס מסך בסיסי עם 4 או 6 ג'יגה זיכרון יחזיק אותו בקלות בלי קיצוצים, ואפשר להריץ אותו אפילו על מכשירי קצה מקומיים.

אם אתם צריכים רק ניתוח של תמונה פה ושם, עדיף להשתמש ב־API מסחרי גדול ולא להתעסק עם שרת משלכם. ההרצה העצמית שווה את המאמץ רק כשחייבים פרטיות מוחלטת, עבודה בלי רשת או זמן תגובה מהיר על מכשיר ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="qnguyen3/nanoLLaVA")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0, שזה רישיון קוד פתוח מתירני מאוד. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית של המפתח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗