GPT
Q

Qwen3.6-27B-AEON-Ultimate-Uncensored-Multimodal-NVFP4-MTP-XS

קוד פתוח

AEON-7apache-2.02026-04-28

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • abliterated

גרסה מכווצת במיוחד של מודל מולטימודלי ללא צנזורה, שרצה בפורמט NVFP4. מי שמחפש אותה צריך מהירות פענוח גבוהה ותפיסת זיכרון מינימלית בכרטיסי Blackwell.

  • 17Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 14,928הורדות בחודש

מה זה

מדובר במודל שמבוסס על משקלי Qwen שעברו הסרת צנזורה וכיול לדחיסת ארבע ביט. השוני המרכזי בגרסת ה־XS הוא כימות אגרסיבי של היטלי ה־GDN ל־NVFP4 כדי לחסוך מקום, תוך שמירה על שכבת ה־conv1d בפורמט BF16 כדי למנוע קריסה ביציבות של חישובי קונטקסט ארוך. המודל שומר על רכיבי הראייה ב־BF16 וכולל ראש MTP מובנה לצורך פענוח ספקולטיבי.

בבדיקות ביצועים מול שרת עם זיכרון אחוד ומודל עזר חיצוני מסוג DFlash, המערכת מגיעה למהירות של 42.6 טוקנים לשנייה ברצף בודד בקוד, ועד 340 טוקנים לשנייה במקביליות של 64 בקשות בהסקה לוגית. קצב קבלת הטוקנים של הניחוש הספקולטיבי עומד על כ־35% בטקסטים קצרים ומטפס ל־45% בקונטקסט של 9,000 טוקנים. חילוץ נתונים ומתמטיקה מציגים קצב קבלה גבוה יותר מטקסט חופשי ופרוזה, מה שמשפיע ישירות על מהירות הפליטה.

מתאים ל

  • חילוץ נתונים ו־JSON מהיר

    מגיע ליותר מ־57 טוקנים לשנייה ברצף יחיד בזכות אחוזי קבלה ספקולטיביים גבוהים במבנים קשיחים.

  • שרת מקומי בכרטיס יחיד

    צורך רק 22GB זיכרון ומאפשר להריץ מודל 27B יחד עם חלון הקשר סביר על גבי RTX 5090 יחיד.

  • עיבוד שאילתות ארוכות

    שומר על קצב קבלת טוקנים של 45% גם בהקשר של 9,000 טוקנים תודות לשכבות קשב ייעודיות במודל העזר.

איפה זה נופל

הכרטיס מודה במפורש שיכולות הראייה במודל טרם עברו ולידציה מלאה בזמן ריצה על הקונטיינר הנוכחי, למרות שהמשקלים נטענים כראוי. חיבור ל־DFlash מחייב להשאיר את ה־KV cache בפורמט BF16 ולא מאפשר כרגע דחיסה ל־FP8, מה שמגדיל את צריכת הזיכרון בקונטקסטים עמוקים. בשימוש בזיכרון אחוד, ניצול זיכרון שחוצה את רף 0.8 גורם לתקיעת השרת. בנוסף, בטקסטים יצירתיים קצב קבלת הטוקנים הספקולטיביים צונח לאזור 18% עד 23%, מה שמוריד משמעותית את מהירות הפענוח.

שאלות
נפוצות

האם כדאי להריץ את המודל על כרטיס RTX 4090?

לא מומלץ. הארכיטקטורה של המודל מבוססת על NVFP4 שמקבל האצה חומרתית רק החל מסדרת Blackwell. בכרטיסים ישנים יותר המשקלים יומרו בחזרה ל־BF16 בזמן פעולה ולא תראו חיסכון בזיכרון או שיפור במהירות.

מה ההבדל המעשי בין גרסה זו לגרסת ה־MTP הרגילה?

גרסת ה־XS מקטינה את צריכת הזיכרון בכ־6GB על ידי דחיסת היטלי ה־GDN ל־NVFP4 במקום השארתם ב־BF16. אם יש לכם כרטיס עם 48GB ומעלה עדיף לבחור בגרסה המלאה ליציבות מספרית עדיפה, אך לכרטיסי 32GB גרסת ה־XS היא היחידה שנכנסת בצורה נקייה.

איך בוחרים בין ראש ה־MTP המובנה לבין מודל DFlash חיצוני?

הבחירה תלויה בסוג הזיכרון של המכונה. בשרתים מבוססי זיכרון אחוד DFlash מציג ביצועים עדיפים בהרבה, בעוד שבכרטיסי מסך עם זיכרון VRAM עצמאי וייעודי ראש ה־MTP הפנימי מספק מהירות גבוהה יותר בלי צורך במודל עזר.

איך מריצים

בפועל מריצים את המודל דרך vLLM 0.23.0 ומעלה, רצוי בתוך קונטיינר ייעודי שתומך בתיקוני DFlash ובקרנלים של sm_121a. בכרטיסי Blackwell בעלי זיכרון ייעודי כמו RTX 5090 עם 32GB או כרטיסי שרת גדולים, מפעילים את ראש ה־MTP המובנה ביחס של שלושה טוקנים לחיזוי עצמי. המודל דורש כ־22GB של VRAM בזמן ריצה, כך שהוא משאיר מרווח לקאש של טוקנים.

אם אתם על חומרת DGX Spark עם זיכרון אחוד, עדיף להריץ אותו יחד עם מודל drafter חיצוני של DFlash בהגדרת עשרה טוקנים, ולהגביל את ניצול הזיכרון ל־0.7 כדי למנוע קריסת עמודי זיכרון. מי שמחזיק כרטיסים ישנים יותר מסדרות Ampere או Hopper לא ירוויח מהדחיסה הזו כי אין בהם תמיכה חומרתית ב־NVFP4, ובמקרים כאלה עדיף לקרוא ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="AEON-7/Qwen3.6-27B-AEON-Ultimate-Uncensored-Multimodal-NVFP4-MTP-XS")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 סטנדרטי. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, לשלב אותו בתוך מוצרים סגורים ולהפיץ אותו הלאה ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים המקורית והטקסט של הרישיון בעת הפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗