GPT
L

Llama-4-Scout-17B-16E-Instruct-GGUF

קוד פתוח

unslothother2025-04-07

  • transformers
  • gguf
  • llama4
  • image-text-to-text
  • facebook

גרסת GGUF מכווצת של Llama 4 Scout שמיועדת להרצה מקומית. מקבלים ארכיטקטורת תערובת מומחים שמפעילה 17 מיליארד פרמטרים מתוך 109 מיליארד בכל טוקן, עם חלון הקשר עצום.

  • 10,485,760טוקנים בהקשר
  • 1.6 TBמשקל הקבצים
  • 39,371הורדות בחודש
  • 165לייקים

מה זה

מטא בנתה כאן מודל מולטימודלי עם תערובת מומחים של 16 מומחים, ו־Unsloth ארזו אותו בפורמט GGUF מכווץ ברמות שונות. על הנייר הוא מפעיל רק 17 מיליארד פרמטרים בכל רגע נתון מתוך 109 מיליארד בסך הכול, מה שנותן מהירות תגובה של מודל קטן יחסית עם בסיס ידע רחב יותר.

במדדי ההיגיון והידע, גרסת ההוראות של Scout מגיעה ל־74.3 אחוז ב־MMLU Pro ול־57.2 אחוז ב־GPQA Diamond. התוצאות האלה מציבות אותו מעל Llama 3.3 70B בפתרון בעיות מורכבות, אף שבכתיבת קוד ב־LiveCodeBench הוא עומד על 32.8 אחוז, כמעט זהה לדור הקודם.

החידוש המרכזי במקור היה תמיכה בתמונות והקשר של עשרה מיליון טוקנים, אבל בגרסת ה־GGUF הנוכחית של Unsloth התמיכה היא בטקסט בלבד. במובן הזה, מקבלים בעיקר את מנוע השפה של Llama 4 בלי רכיב הראייה.

מתאים ל

  • עיבוד טקסטים ארוכים במיוחד

    חלון הקשר של עשרה מיליון טוקנים מאפשר להזין ספרים ומסמכים שלמים בפעם אחת.

  • הסקה לוגית ומדעית

    תוצאות טובות במדדי GPQA Diamond הופכות אותו ליעיל בפיצוח שאלות היגיון ומדע.

  • יצירת נתוני אימון סינתטיים

    הרישיון מאפשר במפורש שימוש בפלטים של המודל כדי לזכך ולאמן מודלים אחרים.

איפה זה נופל

הכרטיס מדגיש שכרגע יש תמיכה בטקסט בלבד בגרסה זו, כך שכל היכולות המולטימודליות של עיבוד תמונות מנוטרלות לחלוטין. בנוסף, רשימת השפות הנתמכות רשמית כוללת 12 שפות בלבד, ועברית אינה מופיעה ביניהן. המודל אמנם נחשף לשפות נוספות באימון הראשוני, אך המפתחים מבהירים ששימוש בשפות שאינן ברשימה דורש כוונון עצמאי ובדיקות זהירות. בביצועי קוד חיים הוא לא מציג שיפור על פני Llama 3.3 70B, ונתוני האימון נעצרו באוגוסט 2024.

אותה משפחה

Llama-4-Scout-17B-16E יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך כרגע בניתוח תמונות?

לא. אף שהמודל המקורי של מטא תוכנן כמולטימודלי, כרטיס המודל של קובצי ה־GGUF האלה מציין במפורש שכרגע נתמך טקסט בלבד.

האם המודל עובד בעברית?

עברית אינה מופיעה ברשימת 12 השפות הנתמכות רשמית. אף שהאימון כלל שפות רבות, מטא מציינת ששימוש מעבר לשפות הרשמיות דורש כוונון נוסף של המפתח ובדיקות זהירות.

איזו גרסת קובץ מומלצת להורדה?

גרסת Q4_K_XL בנפח 65.6 גיגה בייט מסומנת כאיכותית ביותר, ואילו Q2_K_XL בנפח 42.2 גיגה בייט מסומנת כאיזון המומלץ למשאבים מוגבלים.

איך מריצים

בשביל להריץ את המודל צריך כרטיס מסך כבד או זיכרון RAM עצום. הגרסה הקלה ביותר, IQ1_S, שוקלת 33.8 גיגה בייט בדיסק, והגרסה המומלצת ביותר מבחינת איכות, Q4_K_XL, מגיעה לנפח של 65.6 גיגה בייט. בשביל אימון מלא המפתחים מציינים שצריך כרטיס H100 עם 80 גיגה בייט זיכרון.

מי שרוצה את הדיוק המקסימלי יבחר ב־Q4_K_XL, ואילו גרסאות כמו Q2_K_XL בשטח של 42.2 גיגה בייט מוגדרות כפשרה סבירה בין משקל לאיכות. אם אין לכם חומרת שרת ייעודית, עדיף להשתמש ב־API מרוחק במקום להשקיע ברכישת חומרה שתוכל לפרוס 35 עד 65 גיגה בייט בזיכרון.

ollama run hf.co/unsloth/Llama-4-Scout-17B-16E-Instruct-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

54 קבצים במאגר, 1.6 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון Llama 4 Community של מטא שמוגדר במאגר כ־other. הרישיון מתיר שימוש מחקרי ומסחרי, ואף מאפשר להשתמש בפלטים לצורך זיכוך ואימון מודלים אחרים, בכפוף למדיניות השימוש המקובל של מטא. מי שמשלב אותו במוצר חייב לציית לתנאי ההסכם של מטא לגבי מגבלות שימוש והפצה.

הרישיון המלא בעמוד המודל ↗