GPT
L

Llama-4-Maverick-17B-128E-Instruct-GGUF

קוד פתוח

unslothother2025-04-08

  • transformers
  • gguf
  • llama4
  • image-text-to-text
  • facebook

גרסת כיול מקוונטטת של מאווריק מבית מטא המיועדת להרצה מקומית. הוא מציע שילוב בין ביצועי ענק של 400 מיליארד פרמטרים בעזרת ניתוב מומחים לבין חלון הקשר של מיליון טוקנים.

  • 1,048,576טוקנים בהקשר
  • 6.0 TBמשקל הקבצים
  • 5,826הורדות בחודש
  • 52לייקים

מה זה

מטא בנתה את מאווריק כמודל מומחים שמפעיל רק 17 מיליארד פרמטרים מתוך 400 מיליארד בכל שלב חישוב, ואנסלות' ארזו אותו בפורמט שמאפשר לטעון אותו בכלים כמו llama.cpp. הוא מגיע עם חלון הקשר של 1,048,576 טוקנים ואימון מקדים על כ־22 טריליון טוקנים. במבחני ידע וקוד כמו LiveCodeBench ו־MMLU Pro, גרסת הבסיס של המודל עקפה בבירור את Llama 3.1 405B הקודמת, וזה אומר יכולת ניתוח עמוקה בהרבה בפחות משאבי ריצה שוטפים.

למרות שהארכיטקטורה המקורית של המודל כוללת מולטימודליות מהקופסה, המימוש הנוכחי בעמוד הזה תומך בטקסט בלבד. הדגש פה הוא על מהירות ויכולת הסקה בעומסים כבדים, כשהמשקל הכולל יורד משמעותית ביחס למשקלי המקור.

מתאים ל

  • ניתוח מסמכים ארוכים

    חלון הקשר של מיליון טוקנים מאפשר לעבד ספריות קוד או תיקי מסמכים שלמים בפרומפט יחיד.

  • פתרון בעיות קוד מורכבות

    המודל השיג 43.4 אחוז ב־LiveCodeBench, תוצאה גבוהה בהרבה מהדור הקודם שמתאימה לסקירת קוד.

  • זיקוק מודלים ודאטה סינתטי

    רישיון המודל מאפשר מפורשות לייצר פלטים לצורך אימון מודלים קטנים יותר בארגון.

איפה זה נופל

ההגבלה הבולטת ביותר כאן היא שהקובץ תומך כרגע בטקסט בלבד, כך שכל יכולות התמונה של מאווריק חסומות במימוש הזה. בנוסף, עברית אינה מופיעה ברשימת 12 השפות הנתמכות רשמית, והאימון הכללי מסתיים באוגוסט 2024. נקודה נוספת היא הקוונטוז האגרסיבי, ברמות של 1.78 עד 2.71 ביט למומחה תיתכן ירידה מורגשת בדיוק במשימות היגיון מורכבות לעומת משקלי המקור.

שאלות
נפוצות

האם אפשר לשלוח למודל תמונות בגרסה הזו?

לא. למרות שהמודל המקורי מולטימודלי, המפרסם מציין במפורש שבגרסת ה־GGUF הזו נתמך טקסט בלבד.

איזו גרסת קוונט כדאי להוריד?

ההמלצה בעמוד היא Q2_K_XL בנפח 151 גיגה בייט לפשרה טובה, או Q4_K_XL בנפח 243 גיגה בייט אם הדיוק הוא השיקול העליון ויש מספיק זיכרון.

האם המודל יודע לעבוד בעברית?

עברית אינה ברשימת השפות הנתמכות רשמית. המודל נחשף לשפות רבות באימון, אבל לשימוש רציני בעברית תצטרכו לבדוק את הפלטים היטב או לבצע כיול ייעודי.

איך מריצים

קבצי ה־GGUF הזמינים נעים בין 122 גיגה בייט בגרסת IQ1_S ועד 243 גיגה בייט בגרסת Q4_K_XL המומלצת לדיוק מרבי. גרסת האמצע Q2_K_XL תופסת 151 גיגה בייט ומסומנת כהצעה המאוזנת, אך עדיין דורשת מערך של כמה כרטיסי שרת עם זיכרון וידאו מצטבר גבוה כדי להחזיק את כל המשקלים יחד עם זיכרון ההקשר.

אם אין לכם שרת ייעודי של כמה כרטיסי H100 או A100 זמינים, חבל על הזמן של ההורדה וההגדרה. במקרה כזה עדיף לצרוך את המודל דרך ספק API חיצוני במקום לנסות לדחוס 150 גיגה בייט של משקלים לחומרה מקומית צפופה.

ollama run hf.co/unsloth/Llama-4-Maverick-17B-128E-Instruct-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

151 קבצים במאגר, 6.0 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ומבוסס על הסכם הקהילה של Llama 4 מבית מטא. השימוש המסחרי והמחקרי מותר, כולל יצירת נתונים סינתטיים וזיקוק למודלים אחרים, בכפוף לתנאי השימוש המקובלים של מטא ומגבלות הפצה מסחרית רחבה.

הרישיון המלא בעמוד המודל ↗