GPT
L

Llama-3.3-70B-Instruct-NVFP4

קוד פתוח

nvidiallama3.32025-01-16

  • safetensors
  • llama
  • 8-bit

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

גרסה מכווצת של מודל הדגל הפתוח של מטא שדורשת פי 3.3 פחות זיכרון. מיועדת למי שמחזיק חומרה מתאימה ורוצה כוח של 70 מיליארד פרמטרים בנפח קטן.

  • 41Bפרמטרים
  • 131,072טוקנים בהקשר
  • 39.8 GBמשקל הקבצים
  • 562,615הורדות בחודש

מה זה

מדובר בהמרה של Llama 3.3 70B Instruct לפורמט FP4 שבוצעה באמצעות TensorRT Model Optimizer. התהליך הזה כיווץ את המשקולות והאקטיבציות של השכבות הליניאריות מ־16 ביט ל־4 ביט, כך שכל המשקלים שוקלים 39.8 גיגה בייט במקום הנפח המקורי. הכיול עצמו בוצע על בסיס סט הנתונים של cnn_dailymail.

היתרון המרכזי כאן הוא שמירה על ביצועים כמעט זהים למקור. במבחני IFEVAL המודל שומר על ציון של 92 לעומת 92.1 במקור, וב־ARC Challenge הוא יורד מ־93.7 ל־93.3 בלבד. הירידה מורגשת יותר במשימות היגיון ומתמטיקה, שם GSM8K יורד מ־95.3 ל־92.6, וב־MMLU שנחתך מ־83.3 ל־81.1. זה עדיין מחיר זניח ביחס לחיסכון הפיזי במשאבים.

מתאים ל

  • שרתי הסקה בארכיטקטורת B200

    מאפשר לדחוס מודל ענק לתוך כרטיס יחיד עם דרישות זיכרון נמוכות פי 3.3.

  • עיבוד טקסט ארוך ב־128K

    ניתוח מסמכים גדולים ומורכבים תוך שמירה על זיכרון פנוי לעומסי עבודה כבדים.

  • יישומי שיחה הדורשים דיוק גבוה

    מציג ירידה של עשירית הנקודה בלבד במבחן IFEVAL להבנת הוראות ביחס למקור.

איפה זה נופל

המגבלה הכי קשה היא תאימות החומרה. המודל נבנה במיוחד עבור Blackwell, ולכן לא יעבוד על שרתי GPU מדור Hopper או Ampere שרוב החברות מחזיקות כיום. בנוסף, מנוע ההרצה היחיד שנתמך הוא TensorRT-LLM, כך שאי אפשר להשתמש בספריות כמו vLLM בלי התאמות ייעודיות שלא קיימות בחומר. יש גם ירידה קלה בדיוק ביחס למקור, בעיקר במתמטיקה מורכבת שבה הוא מאבד כמעט שלוש נקודות מלאות.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי A100 או H100?

הכרטיס מציין תמיכה בארכיטקטורת Blackwell בלבד ומציג בדיקות על B200. פורמט NVFP4 לא מיועד להרצה על דורות קודמים, ולכן תיתקלו בשגיאות תאימות בזמן הטעינה.

איך מריצים אותו בקוד Python?

טוענים את המודל ישירות דרך מודול LLM של ספריית tensorrt_llm בלינוקס, מגדירים פרמטרי דגימה ומריצים הסקה פשוטה. אין תמיכה בספריות אחרות כמו Hugging Face transformers להרצה ישירה.

איך מריצים

המודל הזה דורש סביבת לינוקס ומנוע TensorRT-LLM בלבד. מבחינת חומרה, הוא תומך בארכיטקטורת NVIDIA Blackwell ונבדק על שבבי B200, כך שכרטיסים רגילים מהדורות הקודמים פשוט לא יריצו את הפורמט הזה בצורה ישירה.

אם אין לכם גישה למעבדי Blackwell בענן או בשרת מקומי, אין מה לנסות לפרוס את הקבצים האלה. במצב כזה, עדיף בהרבה לפנות ל־API חיצוני שמספק גישה למודל המקורי, או לחפש כימוץ בפורמטים שנתמכים בחומרה שבידיכם כמו AWQ או GGUF.

pip install -U huggingface_hub
hf download nvidia/Llama-3.3-70B-Instruct-NVFP4

הרישיון

המודל כפוף לשני רישיונות במקביל, הרישיון המקורי של llama3.3 מבית מטא ורישיון nvidia open model license. הרישיונות מתירים שימוש מסחרי ומחקר, אך מחייבים עמידה בכללי השימוש של מטא בנוגע להפצה ותיוג המוצר הסופי.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗