GPT
H

Huihui-Qwen3.8-27B-abliterated-NVFP4

קוד פתוח

sakamakismileapache-2.02026-08-16

  • vllm
  • safetensors
  • qwen3_5
  • nvfp4
  • compressed-tensors

גרסה מכווצת של מודל 27B שעבר הסרת סינון, מותאמת ישירות לחומרת בלקוול. היא מאפשרת להריץ מודל חשיבה פתוח על זיכרון נמוך משמעותית מהמקור בלי לאבד את רכיב הפיענוח המהיר.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 64,668הורדות בחודש

מה זה

המודל מבוסס על גרסה לא מצונזרת של Qwen 27B, שעברה קוונטיזציה של 4 ביט מסוג NVFP4. המשקל ירד מ־55.6 גיגה־בייט ל־20 גיגה־בייט בלבד, מה שמאפשר לדחוס אותו לשני כרטיסים של 16 גיגה עם מספיק מקום פנוי לזיכרון הקשר. החלק המעניין הוא שהיוצר שמר על רכיבים קריטיים כמו ראש הפיענוח המשוער ורכיב הראייה בדיוק מקורי של 16 ביט, כך שטכניקת הניחוש עובדת ישר מהקופסה.

בעדכון האחרון צמצמו את הסרת הסינון רק לשכבות 18 עד 51 במקום כל השכבות העליונות, כדי לשמור על היכולות המקוריות של הרשת. בדיקות ביצועים מראות קצב של 66.6 טוקנים לשנייה במשתמש יחיד ועד כ־368 טוקנים בעומס מקבילי, עם שיעור קבלת ניחושים של סביב 45 עד 47 אחוזים. סט מבחנים שכלל חשבון, הסתברות, כתיבת קוד ותרגום עבר בהצלחה, אם כי צמצום הפגיעה בשכבות לא הציג שיפור מדיד בבדיקות אלה מעבר לפתרון תקלות ספציפיות.

מתאים ל

  • שרת פיתוח ללא צנזורה

    מאפשר הרצת מודל חשיבה עמוק שאינו מוגבל בהנחיות סינון, על מערך חומרה מקומי וחסכוני בזיכרון.

  • הסקה מהירה מקבילית

    מתאים לעבודה בעומס של משתמשים רבים הודות לניצול ראש הניחוש המשוער שמאיץ את ייצור הטוקנים.

  • עיבוד טקסטים בהקשר ארוך

    מנצל גודל קבצים קטן של 20 גיגה כדי להשאיר מאות אלפי טוקנים פנויים בזיכרון ה־KV על כרטיסי 16 גיגה.

איפה זה נופל

בכתיבת קבצי קוד ארוכים יש באג שחוזר על עצמו: המודל נוטה להשמיט סוגר סוגר בערך פעם או פעמיים מתוך 14 ריצות, ללא תלות בטמפרטורה, כך שחובה להצמיד לו בודק תחביר אוטומטי ולא לסמוך על הפלט בעיניים עצומות.

בנוסף, מצבי החשיבה מנוהלים כולם דרך הזרקת פרומפטים ולא כמנגנון מובנה. רמת החשיבה הגבוהה תוקנה וכבר לא נכנסת ללולאות אינסופיות של חשיבה ללא פלט, אבל רמת הביניים פשוט מוחקת לחלוטין את הנחיות ההעמקה ומשאירה את המודל ללא תהליך חשיבה מונחה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי מסך ישנים יותר?

לא. הדחיסה נעשתה בפורמט NVFP4 W4A4 שמיועד לחומרת Blackwell בלבד. על כרטיסים ישנים יותר השרת ייכשל בעלייה בגלל חוסר תמיכה בארכיטקטורת החישוב.

מה קורה אם מסירים את רכיבי MTP מהגדרות ההתעלמות בקוונטיזציה?

ראש הניחוש המשוער יידרס לפורמט של 4 ביט במקום 16 ביט. זה יגרום לכך שאחוז קבלת הטוקנים יתרסק לאפס, והמודל ירוץ לאט יותר מאשר בלי פיענוח משוער כלל.

האם רכיב הראייה נבדק בגרסה הזו?

רכיב הראייה נשמר בדיוק המקורי שלו ולא נדחס, אך הוא לא נבדק במבחני הביצועים של הגרסה הזו. המדידות והבדיקות שפורסמו תקפות לטקסט בלבד.

איך מריצים

המודל דורש ארכיטקטורת Blackwell כמו סדרת RTX PRO 2000 ומעלה, ורץ ישירות על vLLM בגרסה 0.22 ומעלה שמזהה את הדחיסה אוטומטית. בפועל תצטרכו לפחות שני כרטיסי 16 גיגה־בייט או מערך של ארבעה כרטיסים אם אתם רוצים לעבוד עם הקשרים ארוכים וקאש במבנה FP8. פקודת ההרצה כוללת הגדרת מקביליות ושימוש בראש הניחוש המובנה שמגיע עם המודל.

אם אין לכם כרטיסי בלקוול, אין שום סיבה להוריד את הגרסה הזו. המודל בנוי ספציפית לתצורת W4A4 לחומרה הזו, וניסיון להריץ אותו על ארכיטקטורות ישנות יותר או בתצורות כמו W4A16 פשוט יכשיל את השרת בזמן העלייה.

pip install -U huggingface_hub
hf download sakamakismile/Huihui-Qwen3.8-27B-abliterated-NVFP4

הרישיון

המודל מופץ תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני מאוד שמתיר שימוש מסחרי, שינוי קוד, הפצה מחדש ושילוב במוצרים סגורים ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗