GPT
L

unsloth/Llama-4-Scout-17B-16E-Instruct

קוד פתוח

unslothother2025-04-05

  • transformers
  • safetensors
  • llama4
  • image-text-to-text
  • facebook

שילוב של ראייה וטקסט עם ארכיטקטורת מומחים וחלון ענק. הוא מפעיל 17 מיליארד פרמטרים בכל שלב מתוך 109 מיליארד, ומיועד למי שחייב מודל פתוח לעיבוד מסמכים ותמונות בלי לשלם על ענק של 400B.

  • 109Bפרמטרים
  • 10,485,760טוקנים בהקשר
  • 202 GBמשקל הקבצים
  • 4,901הורדות בחודש

מה זה

מטא בנתה כאן מודל רב מודלי מובנה שמשלב טקסט ותמונה כבר בשכבות המוקדמות, עם 16 מומחים שמהם מופעלים רק 17 מיליארד פרמטרים בכל טוקן. חלון ההקשר מגיע לעשרה מיליון טוקנים, והאימון כלל כארבעים טריליון טוקנים ממאגרים ציבוריים, אינטראקציות עם מטא ופוסטים מפייסבוק ואינסטגרם עד אוגוסט 2024.

במדדי ההוראות הוא מציג 94.4 אחוז במבחן DocVQA להבנת מסמכים ו־88.8 אחוז בגרפים ב־ChartQA, תוצאות שמשתוות או עוברות את Llama 3.3 של שבעים מיליארד פרמטרים. במתמטיקה ובהיגיון הוא עומד על 74.3 אחוז ב־MMLU Pro ו־57.2 אחוז ב־GPQA Diamond, שזה שיפור מורגש על פני הדור הקודם, אך בקוד ב־LiveCodeBench הוא קיבל 32.8 אחוז בלבד, קצת מתחת ל־33.3 של ה־70B הישן.

מתאים ל

  • ניתוח מסמכים וטבלאות

    תוצאה של 94.4 אחוז ב־DocVQA ו־88.8 אחוז בגרפים מאפשרת חילוץ נתונים מדויק מדוחות סרוקים ומורכבים.

  • סוכן שיחה רב מודלי

    הארכיטקטורה מפעילה רק 17 מיליארד פרמטרים ומאפשרת תגובות מהירות יחסית לשאלות המשלבות תמונות וטקסט.

  • יצירת דאטה סינתטי

    הרישיון של מטא מאשר במפורש להשתמש בפלטים שלו כדי לאמן ולזקק מודלים קטנים יותר.

איפה זה נופל

המודל נבדק רשמית על חמש תמונות בלבד בכל קלט, כך שמי שבונה עליו לעיבוד רצף ארוך של תמונות יצטרך לבדוק את היציבות בעצמו. עברית אינה מופיעה ברשימת 12 השפות הנתמכות רשמית, שכוללת שפות כמו אנגלית, ספרדית וערבית, למרות שבאימון המקדים היו כמאתיים שפות. נוסף על כך, הביצועים שלו בכתיבת קוד נמוכים יותר מ־Llama 3.3 הוותיק.

אותה משפחה

Llama-4-Scout-17B-16E יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה שוטפת?

עברית אינה מופיעה ברשימת 12 השפות הנתמכות שפורסמו בכרטיס המודל. אף על פי שהאימון המקדים כלל מאתיים שפות, מטא מטילה על המפתח את האחריות לבדוק התנהגות ובטיחות בכל שפה שלא נבדקה רשמית, כך שמומלץ לבצע בדיקות יסודיות לפני הטמעה.

האם כדאי לשדרג מ־Llama 3.3 70B?

אם המערכת שלכם דורשת קלט של תמונות או חלון הקשר עצום, המודל הזה מציע יתרון מובהק כי לדור הקודם לא היו יכולות ראייה. מנגד, אם השימוש שלכם מתמקד בעיקר במשימות תכנות וקוד, המדידות מראות שהביצועים שלו דומים ואף מעט נמוכים יותר מה־70B הקודם.

איך מריצים

כדי לטעון את המשקולות המקוריות בדיוק bfloat16 תצטרכו לפחות 202 גיגה בייט של זיכרון GPU, שזה אומר מערך של שלושה כרטיסי H100 של 80 גיגה בייט לפחות רק בשביל להחזיק את המודל בזיכרון, עוד לפני שלוקחים בחשבון את חלון ההקשר. לפי התיעוד אפשר להריץ קוונטיזציה ל־int4 בזמן אמת וכך לדחוס אותו לכרטיס H100 בודד, מה שחוסך חומרה אבל דורש בדיקת ביצועים.

אם אין לכם קלאסטר שרתים ייעודי עם רוחב פס גבוה בין הכרטיסים, אין היגיון כלכלי להריץ מודל של 109 מיליארד פרמטרים לבד בבית או על שרת ענן שכור לשעות בודדות. במקרים כאלה עדיף לגשת אליו דרך ספקי ענן שמוכרים גישה לפי טוקן.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/Llama-4-Scout-17B-16E-Instruct")
print(pipe("שלום"))

הקבצים

64 קבצים במאגר, 202 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון הקהילה של Llama 4 שמתיר שימוש מחקרי ומסחרי, כולל יצירת נתונים סינתטיים וזיקוק למודלים אחרים. השימוש כפוף למדיניות השימוש ההוגן של מטא, והמפתחים אחראים לבטיחות אם מפעילים אותו בשפות שאינן ברשימה הנתמכת.

הרישיון המלא בעמוד המודל ↗