GPT
Q

Qwen3.8-27B-NVFP4

קוד פתוח

unslothapache-2.02026-08-13

  • safetensors
  • qwen3_5
  • unsloth
  • compressed-tensors

גרסת קוונטיזציה NVFP4 למודל שמשלב טקסט וראייה, עם 20 מיליארד פרמטרים בפועל. היא נועדה להריץ משימות סוכנים ועיבוד וידאו ארוך על חומרה מקומית בלי לבלוע זיכרון של שרת שלם.

  • 20Bפרמטרים
  • 262,144טוקנים בהקשר
  • 21.8 GBמשקל הקבצים
  • 3,263,102הורדות בחודש

מה זה

מדובר במודל שפה וראייה צפוף עם ארכיטקטורה מודרנית שמשלבת שכבות Gated DeltaNet עם תשומת לב מסורתית ומנגנון חיזוי מרובה טוקנים. הוא מקבל קלט ויזואלי של תמונות או סרטונים באורך של שעות, ומגיע עם תמיכה מובנית במצב חשיבה עמוקה שניתן להדליק, לכבות או לכוונן לפי רמת המאמץ הנדרשת. בנוסף, הוא מיועד לעבוד עם כלים חיצוניים וסוכנים בזכות יכולת משופרת לפענח אובייקטים מקוננים ותמיכה בתפקיד מפתח.

הייחוד בגרסה הזו הוא הדחיסה שיצרו בצוות של Unsloth בשיטת Dynamic V3.0 בפורמט NVFP4. במקום להחזיק משקלים מלאים וכבדים, מקבלים את היכולות של המודל בקובצי משקל של 21.8 גיגה בייט, כאשר שכבת הפלט נשמרת בפורמט FP8 כדי לשמור על איכות הפלט הסופי. החלון הטבעי עומד על 262,144 טוקנים עם אפשרות הרחבה למיליון באמצעות YaRN, כך שהוא מסוגל להתמודד עם כמויות מידע שדורשות בדרך כלל מודלים גדולים בהרבה.

מתאים ל

  • סוכני פיתוח אוטונומיים

    תמיכה בתפקיד מפתח ופענוח אובייקטים מקוננים לקריאות כלים אמינות במסגרות כמו Codex.

  • ניתוח סרטוני וידאו ארוכים

    הבנת וידאו ברמת שעות בחלון הקשר ענק, בתנאי שמשנים את הגדרות הדגימה של המעבד.

  • מחקר ופתרון בעיות מורכבות

    מצב חשיבה מובנה עם שליטה ברמת המאמץ ושמירת היסטוריית החשיבה בין הודעות.

איפה זה נופל

המודל כולל מספר מגבלות טכניות מוגדרות. ראשית, שכבת הראייה מגיעה מהקופסה בהגדרה שמרנית למדי כדי לחסוך משאבים, כך שאם לא משנים ידנית את קובץ ההגדרות עבור וידאו ארוך, קצב הדגימה של הפריימים יהיה נמוך. שנית, המפתחים מזהירים שהעלאת מדד הענישה על חזרתיות מעבר לרגיל עלולה לגרום לערבוב שפות ולפגיעה באיכות התשובות. בנוסף, התמיכה ב־SGLang שבורה בכל גרסה שאינה 0.5.19 בדיוק בגלל ששכבת ה־lm_head לא עברה קוונטיזציה ל־4 ביט.

שאלות
נפוצות

למה המודל רץ רק בגרסה מסוימת של SGLang?

הקוונטיזציה של Unsloth השאירה את שכבת הפלט בפורמט FP8 ולא 4 ביט כדי לשמור על איכות. הדבר דורש תמיכה ספציפית שקיימת כרגע רק בגרסה 0.5.19 של SGLang, בעוד שב־vLLM הוא רץ ללא תלות כזו.

האם מצב החשיבה מופעל תמיד?

הוא מופעל כברירת מחדל, אבל ניתן לכבות אותו בכל בקשה בנפרד. כשמכבים אותו, המפתחים ממליצים לשנות את פרמטרי הדגימה, כמו הורדת הטמפרטורה ל־0.7 והעלאת מקדם הענישה על חזרתיות ל־1.5.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך שתומך בפורמטים מודרניים של 4 ביט עם מספיק VRAM להחזיק 21.8 גיגה בייט של משקלים, ועוד מרווח עבור הזיכרון של ההקשר. המודל רץ בצורה חלקה מעל vLLM או בתוכנת Unsloth Desktop, ונתמך גם בגרסה ספציפית מאוד של SGLang, גרסה 0.5.19, בגלל ששכבת הראש נשמרה בפורמט FP8 ולא ב־4 ביט.

אם אתם צריכים לפתוח את מלוא חלון ההקשר של 262 אלף טוקנים, תצטרכו שרשור של מספר כרטיסים רק עבור הזיכרון של ה־KV Cache. אם אין לכם חומרה ייעודית כזו או שאתם מתכננים לעבד סרטונים ארוכים רק לעיתים רחוקות, עדיף לפנות ל־API חיצוני במקום לקנות כרטיסים יקרים.

pip install -U huggingface_hub
hf download unsloth/Qwen3.8-27B-NVFP4

הרישיון

המודל מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, שילוב בתוך מוצרים פנימיים והפצה ללקוחות. התנאים העיקריים הם מתן קרדיט מתאים, צירוף עותק של הרישיון ושמירה על הצהרות זכויות היוצרים המקוריות, ללא דרישה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗