GPT
Q

Qwen3.6-27B-AEON-Ultimate-Uncensored-Multimodal-NVFP4-MTP

קוד פתוח

AEON-7apache-2.02026-04-28

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • abliterated

גרסה מכווצת בפורמט NVFP4 של Qwen 3.6 27B ללא סינון תכנים, ששומרת על יכולות ראייה. היא כוללת ראש חיזוי מובנה שמאפשר האצה משמעותית של הפקת הטקסט על גבי כרטיסי מסך תואמים.

  • 20Bפרמטרים
  • 262,144טוקנים בהקשר
  • 26.6 GBמשקל הקבצים
  • 4,735הורדות בחודש

מה זה

מדובר במודל שמבוסס על Qwen 3.6 27B שעבר הסרת סירובים מלאה וכיווץ באמצעות כלי האופטימיזציה של אנבידיה. הגוף המרכזי מכווץ לארבעה ביטים, אבל שכבות המבנה ההיברידי של הקשב, רכיבי עיבוד התמונה וראש החיזוי נשמרו ברמת דיוק מקורית כדי למנוע קריסה של היכולות. השילוב הזה משאיר אותו עם יכולת מלאה לקבל תמונות וטקסט יחד.

ההבדל המשמעותי מול גרסאות אחרות הוא חיבור מחדש של ראש הניבוי הרב טוקני. במקום להוריד מודל מנחש נפרד כדי להאיץ את תהליך הפקת הטקסט, המודל משתמש ברשת הפנימית שלו כמנחש. על חומרת Blackwell ייעודית כמו RTX PRO 6000 נמדדה מהירות חציונית של סביב 92 טוקנים לשנייה, עם קבלת ניחושים של 67.7 אחוזים, בלי לפגוע בהבנה של משימות מורכבות.

מתאים ל

  • ניתוח מסמכים ותמונות

    חלון הקשר גדול ורכיב ראייה מלא שמתאימים לעיבוד חומרים ארוכים משולבי מדיה על כרטיס בודד.

  • הפקת טקסט מהירה לממשקים

    ראש הניבוי המובנה מספק קצב פלט גבוה מאוד בשרתים ייעודיים ללא צורך בהקצאת זיכרון למודל עזר נוסף.

  • בוטים ללא מגבלות נושא

    מענה לפניות ללא מנגנוני סירוב מובנים, עבור מערכות שדורשות שליטה מלאה בתוכן דרך שכבת האפליקציה.

איפה זה נופל

הפורמט הזה לא מיועד לכרטיסים מהדור הקודם, ושום טריק תוכנתי לא ייתן יתרון מהירות על חומרת אמפר או הופר. בנוסף, זיכרון משותף גורם לפגיעה קשה בביצועי ראש הניבוי עד כדי כך שעדיף לכבות אותו ולעבוד עם מודל מנחש חיצוני. מעבר לזה, המודל עבר הסרה מוחלטת של מנגנוני הסירוב והבטיחות, כך שאין לו שום מעצורים עצמיים וכל סינון תוכן, הגנה או וידוא פלט ייפלו באופן בלעדי על שכבת הקוד שלכם.

שאלות
נפוצות

האם המודל ירוץ מהר על כרטיס H100 או A100?

לא. כרטיסי Ampere ו־Hopper אינם כוללים תמיכת חומרה בפורמט NVFP4. מנוע ההרצה ייאלץ להמיר את המשקלים חזרה לרמת דיוק BF16 בזמן אמת, מה שיבטל כל יתרון ביצועים. לכרטיסים כאלה עדיף להוריד ישירות את גרסת ה־BF16 המלאה.

מדוע המודל מקרטע על מחשבי DGX Spark עם מעבדי GB10?

רוחב הפס של הזיכרון המאוחד בשרתים האלה מוגבל ביחס לכרטיסים ייעודיים, ולכן עלות בדיקת הניחושים של ראש החיזוי גבוהה מהרווח. על החומרה הזו נמדדו רק 24.1 טוקנים לשנייה עם ראש הניבוי, לעומת 38.5 טוקנים לשנייה כאשר עובדים עם מודל מנחש מסוג DFlash.

האם חובה להוריד מודל מנחש נוסף כדי לקבל האצה?

אין צורך. ראש הניבוי כבר מוטמע בתוך קובצי המשקלים של המודל הזה. כל מה שצריך זה להגדיר בפקודת ההרצה של vLLM את תצורת הניחוש הפנימית עם שלושה טוקנים קדימה.

איך מריצים

ההרצה נעשית ישירות דרך מנוע vLLM בגרסה 0.24.0 ומעלה, עם הגדרת קוונטיזציה של modelopt והפעלת מנגנון החיזוי הפנימי לשלושה טוקנים קדימה. חובה להשתמש בכרטיסי מסך מהארכיטקטורות החדשות שתומכות בחישובי FP4 בחומרה, כמו RTX PRO 6000, RTX 5090 או סדרת B100 ו־B200. מומלץ לקבוע את ניצול הזיכרון ל־0.94 לכל היותר כדי למנוע קריסת זיכרון בעלייה.

על גבי מערכות עם זיכרון משותף כמו DGX Spark או מעבדי GB10, התקורה של הזיכרון חונקת את ראש הניבוי, ושם שיטת DFlash עוקפת אותו ומגיעה ל־38.5 טוקנים לשנייה. אם יש לכם כרטיסי A100 או H100 אין טעם לנסות להריץ את הגרסה הזו כי החומרה תמיר את המשקלים חזרה לרמת דיוק גבוהה, ובמצב כזה עדיף לצרוך API או להריץ את גרסת הדיוק המלאה.

from transformers import pipeline

pipe = pipeline("text-generation", model="AEON-7/Qwen3.6-27B-AEON-Ultimate-Uncensored-Multimodal-NVFP4-MTP")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 שמאפשר שימוש מסחרי מלא, שינוי קוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים המקוריות. עם זאת, מכיוון שהמודל נטול מנגנוני סירוב, האחריות המשפטית לכל שימוש, נזק או חשיפת תוכן פוגעני מוטלת לגמרי על מי שמטמיע אותו במוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗