GPT
L

Llama-3.2-11B-Vision-Instruct-GGUF

קוד פתוח

leafsparkllama3.22024-10-26

  • gguf
  • endpoints_compatible
  • conversational

גרסת GGUF שמשלבת עיבוד תמונה וטקסט בנפח של 11 מיליארד פרמטרים. היא נועדה למי שרוצה להריץ הבנת תמונות מקומית בלי לצאת לענן של חברות צד שלישי.

  • 35.3 GBמשקל הקבצים
  • 12,554הורדות בחודש
  • 70לייקים

מה זה

מדובר במודל רב־מודאלי שמקבל תמונות לצד טקסט ופולט טקסט. הוא מכוון בעיקר למשימות של זיהוי חזותי, הסקת מסקנות מתמונות, כתיבת כיתובים ותשובות לשאלות על תוכן ויזואלי. ההמרה לפורמט GGUF נלקחה ישירות מהמימוש של Ollama, מה שמקל על שילוב שלו בכלים שתומכים בספריית llama.cpp.

בגודל של 11 מיליארד פרמטרים, הוא מנסה לתת מענה סביר למשימות ראייה ממוחשבת בלי לדרוש את משאבי הענק של גרסת ה־90B. היוצרים טוענים לביצועים שעוקפים מודלים פתוחים וסגורים במבחנים מקובלים, אבל בפועל מדובר בעיקר בנקודת כניסה נוחה למי שחייב מודל ראייה מקומי על שרת יחיד.

מתאים ל

  • תיאור תמונות אוטומטי

    יצירת כיתובים מפורטים לתמונות באתרי תוכן ומאגרי מדיה ישירות על השרת שלכם.

  • מענה על שאלות חזותיות

    קבלת תמונה ושאלה מילולית עליה, והחזרת תשובה טקסטואלית על בסיס הניתוח.

  • זיהוי ויזואלי מקומי

    סיווג והבנה של תוכן תמונה ללא צורך לשלוח מידע רגיש לשירותי ענן חיצוניים.

איפה זה נופל

כרטיס המודל לא חושף נתונים ספציפיים על אחוזי דיוק או מגבלות ברורות, וזה דגל אדום שדורש בדיקה עצמאית. מודלים של 11 מיליארד פרמטרים נוטים לפספס פרטים קטנים בתמונות מורכבות, לסבול מהזיות בטקסט שמופיע בתוך התמונה, ולא להתמודד טוב עם שפות שאינן אנגלית. לפני שאתם בונים עליו למסמכים בעברית או תרשימים טכניים דחוסים, תריצו מבחן עם דוגמאות אמיתיות שלכם.

שאלות
נפוצות

האם המודל תומך בעברית בתוך תמונות?

כרטיס המודל לא מפרט תמיכה בשפות, אבל מודלים מהסדרה הזו מתמקדים בעיקר באנגלית. סביר להניח שזיהוי טקסט עברי מתמונות יהיה חלש ומלא שגיאות, ולכן חובה לבדוק אותו ידנית על הדוגמאות שלכם.

איך מחברים את כל ששת הקבצים להרצה?

תוכנות תואמות GGUF כמו llama.cpp יודעות לקרוא קבצים מפוצלים אוטומטית כל עוד הם נמצאים באותה תיקייה עם שמות הקבצים המקוריים. אתם פשוט מפנים את פקודת ההרצה לחלק הראשון.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־35.3 גיגה־בייט שמחולקים לשישה חלקים, כך שתצטרכו כרטיס מסך עם זיכרון וידאו מכובד או שילוב של זיכרון מערכת וכרטיס גרפי בינוני כדי לטעון אותו במלואו.

אם יש לכם מחשב עם פחות מ־32 גיגה זיכרון פנוי, ההרצה המקומית תזחל או תקרוס. במצב כזה, עדיף להשתמש ב־API מנוהל של מודל ענן ולא להיאבק בהרצה עצמית אלא אם הפרטיות של התמונות מכריחה אתכם לשמור הכל על הברזלים שלכם.

ollama run hf.co/leafspark/Llama-3.2-11B-Vision-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama3.2 של מטא. הוא מאפשר שימוש מסחרי לרוב החברות, אך כולל מגבלות ספציפיות על היקף משתמשים חודשי עצום ואיסור להשתמש בפלטים כדי לאמן מודלים מתחרים. לחברות מקומיות בנפח רגיל אין בעיה להטמיע אותו במוצר.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗