GPT
L

Llama-3-VILA1.5-8B

קוד פתוח

Efficient-Large-Modelcc-by-nc-4.02024-04-30

  • transformers
  • safetensors
  • llava_llama
  • VILA
  • VLM

שילוב של Llama 3 עם רכיב ראייה שמסוגל לעבד רצף של כמה תמונות ואפילו וידאו. הוא מתאים למי שרוצה להריץ מודל רב מודלי על שרת מקומי או כרטיס קצה.

  • 15.8 GBמשקל הקבצים
  • 2,895הורדות בחודש
  • 37לייקים

מה זה

בסיס המודל נשען על Llama 3 בגודל 8B מבית מטא יחד עם SigLIP לקליטת תמונה ווידאו. ההבדל העיקרי מול מודלים פשוטים של תמונה וטקסט הוא היכולת לנתח כמה תמונות יחד ברצף ולא רק תמונה בודדת. המפתחים אימנו אותו על 53 מיליון דוגמאות שמשלבות תמונות וטקסט לסירוגין, תוך הפשרת משקלי שפת האם בזמן האימון, מה שמקנה לו יכולת להבין הקשר ויזואלי מורכב ושרשראות חשיבה בתמונות.

הוא מקבל תמונות RGB, סרטוני MP4 או טקסט רגיל, ופולט טקסט בלבד. במקום לעצור בעיבוד תמונה יחידה, הארכיטקטורה מכוונת להסביר תהליכים לאורך זמן או להשוות בין מקורות ויזואליים שונים.

מתאים ל

  • ניתוח רצף צילומים

    הבנת הקשר בין כמה תמונות עוקבות בזכות אימון ייעודי על טקסט ותמונות לסירוגין.

  • מענה על סרטוני וידאו

    קליטת קובצי MP4 והפקת תובנות טקסטואליות על מה שקורה לאורך הסרטון.

  • הרצה מקומית על כרטיסי קצה

    הפעלת מודל רב מודלי על גבי חומרת Jetson Orin או מחשב מקומי בעזרת גרסת AWQ.

איפה זה נופל

המודל פולט אך ורק טקסט, כך שאי אפשר לצפות ממנו לייצר או לערוך תמונות חזרה. מעבר לכך, הכרטיס מציין שהאימון כלל דאטה שנוצר על ידי OpenAI לצד תמונות רשת, כך שאיכות הניתוח בעברית או על תוכן מקומי ישראלי אינה מובטחת וסביר שתיתקלו בהזיות. אין בתיעוד פירוט על דיוק בזיהוי פרטים זעירים או התמודדות עם טקסט קשה לקריאה, ולכן חובה לבחון את המשימות שלכם ידנית לפני שמסתמכים עליו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך אפליקציה בתשלום?

לא. משקלי המודל שוחררו תחת רישיון לא מסחרי, וכוללים תנאים מגבילים של מטא ודאטה שמקורו ב־OpenAI. הוא מתאים אך ורק לצורכי מחקר, פיתוח פנימי ובדיקות היתכנות.

האם הוא יודע לנתח סרטוני וידאו ארוכים?

הוא מקבל קובצי MP4 ומסוגל להסיק מהם מסקנות, אך הוא אינו מיועד לסרטים שלמים או מעקב רציף של שעות. מומלץ לבדוק קטעים קצרים וממוקדים כדי למנוע חריגה מהזיכרון ונפילה בדיוק.

איך מריצים

המשקלים תופסים כמעט 16 ג'יגה בייט בזיכרון, כך שדרוש כרטיס מסך עם לפחות 24 ג'יגה בייט VRAM כמו RTX 4090 או כרטיסי שרת דוגמת A100. המודל נתמך בסביבות לינוקס דרך PyTorch, TensorRT-LLM או TinyChat. קיימת גם גרסת קוונטיזציה רשמית של 4 ביט באמצעות AWQ, שמאפשרת לדחוף אותו למכשירי קצה כמו Jetson Orin או מחשבים ניידים חזקים.

אם אין לכם כרטיס תואם עם זיכרון ייעודי מספק, להריץ אותו מקומית יהיה איטי מאוד ומסורבל, ובמקרים כאלה עדיף להישען על שירות ענן שמחזיק תשתית מתאימה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Efficient-Large-Model/Llama-3-VILA1.5-8B")
print(pipe("שלום"))

הרישיון

הקוד פתוח תחת Apache 2.0, אבל המשקלים עצמם מוגבלים ברישיון לא מסחרי של CC-BY-NC-4.0 וברישיון Llama 3. בנוסף, האימון כלל דאטה מתוצרי OpenAI שמגביל שימוש תחרותי. המשמעות פשוטה: המודל מיועד למחקר ולניסויים בלבד, ואסור לשלב אותו ישירות במוצר מסחרי שמוכרים ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗