GPT
H

Huihui-Qwen3.6-27B-abliterated-NVFP4-MTP

קוד פתוח

sakamakismileapache-2.02026-04-25

  • vllm
  • safetensors
  • qwen3_5
  • nvfp4
  • modelopt

גרסה מכווצת ומנוטרלת הגנות של מודל ממשפחת קוון 3.5, עם מנגנון חיזוי מובנה להאצת מהירות. מתאים למי שרוצה חשיבה ושימוש בכלים בריצה מקומית מהירה בלי מעצורים תוכניים.

  • 17Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 4,591הורדות בחודש

מה זה

מדובר במודל שמשלב שכבות קשב ליניאריות לצד קשב מלא, שמתוכנן להוזיל משמעותית את צריכת הזיכרון בהקשרים ארוכים. המשקלים עברו קוונטיזציה בפורמט NVFP4 בדיוק של ארבעה ביטים, למעט רכיבים קריטיים כמו ראש המודל ושכבות הניתוב שנשארו בדיוק גבוה כדי למנוע קריסה באיכות הפלט. בנוסף, משולב בו ראש MTP לחיזוי מקבילי של כמה טוקנים, שמקפיץ את קצב הפליטה ללא צורך במודל טיוטה חיצוני.

המודל מגיע כבר אחרי תהליך הסרת צנזורה, כך שהוא עונה ישירות ומציג בלוקי חשיבה בתוך תגיות ייעודיות לצד תמיכה בקריאות לפונקציות וכלים במבנה תחבירי של אקס.אם.אל. במבחני ריצה הוא מספק בין 81 ל־83 טוקנים לשנייה בבקשה בודדת, ומגיע עד קצב שיא של כמעט 880 טוקנים לשנייה כשמעמיסים עליו 24 בקשות במקביל, גם תחת חלון הקשר עצום.

מתאים ל

  • סוכן אוטונומי מקומי

    מפעיל כלים ומנתח בעיות מורכבות דרך בלוקי חשיבה ופורמט פקודות מובנה, בלי לחשוף נתונים פנימיים לרשת חיצונית.

  • ניתוח מסמכים ארוכים

    מאפשר עיבוד מאות אלפי טוקנים בקצב גבוה, בזכות צריכת זיכרון נמוכה ששומרת על מהירות יציבה גם בהקשר רחב.

  • שרת שירות עמוס פניות

    מספק תפוקה של כמעט 880 טוקנים לשנייה בעומס מקבילי, למי שמחזיק שרת ייעודי עם ארבעה כרטיסי בלאקוול.

איפה זה נופל

המודל תלוי לחלוטין בחומרה מדור מסוים שתומכת בליבות החישוב של NVFP4, וללא הדגלים הנכונים המשקלים נקראים כזבל מוחלט. עקב הסרת ההגנות, הוא לא מבצע סינון בטיחותי ועלול לפלוט תוכן בעייתי ללא שום מנגנון ריסון מובנה. בנוסף, תהליך העלייה הראשוני אורך כשתי דקות בגלל קומפילציה, וההרצה נוטה להשאיר תהליכים תקועים בזיכרון של המעבדים הגרפיים במקרה של קריסה, מה שדורש חיסול ידני כדי למנוע שגיאות זיכרון בריצה הבאה.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס יחיד עם 24 גיגה זיכרון?

לא. המודל בנוי ומחולק ספציפית לעבודה על ארבעה כרטיסים במקביל, כשהמשקלים לבדם דורשים מעל 7 גיגה מכל כרטיס לפני שמקצים מקום לקאש. מעבר לכך, הקוונטיזציה מחייבת ארכיטקטורה שתומכת ב־NVFP4.

איך מטפלים במצב שבו השרת קורס ולא עולה מחדש?

במקרים של עצירה פתאומית תהליכי העבודה נשארים תקועים בזיכרון הכרטיס ותופסים נפח. צריך להשתמש בפקודת בדיקת התהליכים של אנבידיה, לזהות את מספרי התהליך של העובדים ולחסל אותם ידנית לפני שמנסים להרים את השרת שוב.

האם המודל יסרב לענות על שאלות רגישות?

הגרסה הזו עברה הסרת הגנות מכוונת, ולכן המודל נוטה לענות על שאלות בלי מנגנוני הסירוב הרגילים שקיימים במודלי בסיס. אם המוצר שלכם פונה למשתמשי קצה, תצטרכו להטמיע שכבת הגנה וסינון עצמאית ביישום שלכם.

איך מריצים

ההרצה מבוססת על vLLM בגרסה 0.22 ומעלה, שכוללת תמיכה מובנית בארכיטקטורה ובחיזוי המקבילי. החומרה שנבדקה ונדרשת בפועל כדי להשיג את הביצועים היא מערך של ארבעה כרטיסי מסך מדור בלאקוול של אנבידיה עם 16 גיגה זיכרון כל אחד, בחלוקה של ארבעה חלקים מקביליים. המשקלים דורשים כ־7.2 גיגה זיכרון לכל כרטיס, והשאר משמש לקאש תחת דיוק FP8.

אם אין לכם שרת ייעודי עם חומרה תומכת בפורמט NVFP4 וארבעה מאיצים מודרניים, אין טעם לנסות להרים את זה לבד. במצב כזה עדיף לצרוך את המודל המקורי דרך שירותי ענן עם ממשק מרוחק, כי הרצה על כרטיסים ישנים או ללא תמיכה מתאימה תהיה איטית מאוד או תיכשל מיד בעלייה.

pip install -U huggingface_hub
hf download sakamakismile/Huihui-Qwen3.6-27B-abliterated-NVFP4-MTP

הרישיון

המודל מופץ תחת רישיון אפאצ'י 2.0, שמאפשר שימוש חופשי, שינוי, הפצה ושילוב במוצרים מסחריים ללא תשלום תמלוגים. התנאים העיקריים דורשים שמירה על הצהרת זכויות היוצרים המקורית, צירוף עותק של הרישיון וציון ברור אם נעשו שינויים בקוד או במשקלים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗