GPT
L

Llama-4-Scout-17B-16E-Instruct-unsloth-bnb-4bit

קוד פתוח

unslothother2025-04-05

  • transformers
  • safetensors
  • llama4
  • image-text-to-text
  • facebook

גרסה מכווצת ב־4 ביט של מודל המומחים מבית מטא, המשלבת עיבוד תמונה וטקסט. היא מיועדת למי שרוצה להריץ חלון הקשר עצום על חומרה מקומית נגישה יותר.

  • 112Bפרמטרים
  • 10,485,760טוקנים בהקשר
  • 56.3 GBמשקל הקבצים
  • 1,269הורדות בחודש

מה זה

מדובר במימוש של ארכיטקטורת תערובת מומחים עם 16 מומחים ובסך הכל 109 מיליארד פרמטרים, כאשר בכל רגע נתון פועלים 17 מיליארד פרמטרים בלבד. הדגם מעבד גם תמונות וגם טקסט ומחזיר טקסט או קוד, עם חלון הקשר חריג שמגיע עד עשרה מיליון טוקנים.

במבחני ביצועים בגרסת המקור, המודל עוקף את Llama 3.3 70B הוותיק ברוב מדדי ההיגיון כמו MMLU Pro שבו הוא מגיע ל־74.3 אחוז, ובמבחן GPQA Diamond שבו הוא מגיע ל־57.2 אחוז דיוק. הבדל משמעותי מול הדור הקודם הוא היכולת לנתח מסמכים ותרשימים ישירות, עם ציון של 94.4 אחוז במבחן DocVQA, מה שחוסך שימוש במודל ראייה נפרד.

מתאים ל

  • ניתוח מסמכים סרוקים

    קריאת גרפים, טבלאות וטקסט מתמונות של דוחות עסקיים בזכות ציון של 94.4 במבחן DocVQA.

  • עיבוד טקסטים ארוכים

    ניתוח של עשרות ספרים או ספריות קוד שלמות בבת אחת תחת חלון הקשר של עשרה מיליון טוקנים.

  • אימון וזיכוך מודלים קטנים

    יצירת דאטה סינתטי ואימון מודלים פנימיים, שימוש שהרישיון של מטא מתיר במפורש.

איפה זה נופל

הנתונים עליהם התאמן המודל נעצרים באוגוסט 2024, כך שהוא לא יודע שום דבר מעבר לזה. בנוסף, יכולת עיבוד התמונות נבדקה ונבחנה רק בעבודה עם עד חמש תמונות בו-זמנית. מעבר למגבלות האלה, עברית אינה מופיעה ברשימת 12 השפות הרשמיות שנתמכות, למרות שמטא ציינה אימון רקע במאות שפות. חובה לבדוק איכות פלט והבנת הנחיות בעברית לפני שבונים עליו משהו אמיתי.

שאלות
נפוצות

האם הקובץ הזה יעבוד לי ישירות ב־vLLM או ב־Ollama?

לא ישר מהקופסה. הקובץ מכויל לעבודה מול ספריית Unsloth בלבד, וכדי להריץ אותו בכלים אחרים צריך להוריד את גרסת ה־GGUF או לייצא אותו דרך הסקריפטים של Unsloth.

האם הוא מסוגל לדבר ולענות בעברית?

הוא ראה עברית באימון הכללי, אבל היא לא ברשימת 12 השפות הנתמכות רשמית. בעבודה שוטפת הוא עלול לעשות שגיאות דקדוקיות או לערבב מילים, כך שמומלץ לבחון את המשימה הספציפית שלכם לפני פיתוח.

איך מריצים

המשקל הכולל של הקבצים עומד על 56.3 גיגה-בייט. הגרסה הספציפית הזו נבנתה לעבודה עם ספריית Unsloth בלבד, ואימון עדין שלה אפשרי על גבי כרטיס H100 בודד עם 80 גיגה זיכרון. להרצה מקומית רגילה מחוץ ל־Unsloth מומלץ לפנות לגרסאות ה־GGUF של המודל.

אם אין לכם כרטיס שרת ייעודי או לפחות שני כרטיסי זיכרון גרפי של 24 גיגה שמחוברים יחד, עדיף להשתמש ב־API מרוחק. החיסכון בכאב הראש של פיצול מודל כזה על חומרה ביתית שווה את התשלום לחברות הענן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/Llama-4-Scout-17B-16E-Instruct-unsloth-bnb-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא Llama 4 Community License Agreement של מטא. הוא מתיר שימוש מסחרי ומחקר, ומאפשר להשתמש בפלטים לצורך זיכוך ויצירת דאטה סינתטי למודלים אחרים, בכפוף לתנאי השימוש המקובלים של מטא.

הרישיון המלא בעמוד המודל ↗