GPT
Q

Qwen3.6-35B-A3B-heretic-NVFP4

קוד פתוח

AEON-7apache-2.02026-04-17

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • 1m-context

גרסה מכווצת בפורמט NVFP4 של מודל מולטימודלי עם הסרת מגבלות סירוב. הוא מיועד למי שמחפש ביצועי חשיבה ועיבוד תמונה על חומרת Blackwell בלי צנזורה מיותרת.

  • 21Bפרמטרים
  • 262,144טוקנים בהקשר
  • 21.8 GBמשקל הקבצים
  • 583,592הורדות בחודש

מה זה

זהו מודל MoE עם כעשרים ואחד מיליארד פרמטרים שמשתמש בשלושה מיליארד פרמטרים פעילים בכל שלב, ועבר הסרת מגבלות שהורידה את שיעור הסירוב שלו לחמישה אחוזים בלבד. הוא משלב יכולות חשיבה, הבנת טקסט ועיבוד תמונה דרך רשת ראייה בת עשרים ושבעה בלוקים שנשמרה בדיוק המקורי שלה. שכבות המומחים כווצו לפורמט ארבע ביט כדי לאפשר עבודה מהירה ויציבה על חומרה תואמת.

בבדיקות ביצועים עם מודל טיוטה ייעודי הוא מציג קצב של מעל תשעים טוקנים לשנייה בזרם בודד על קוד, ומגיע עד שבע מאות וארבעים טוקנים לשנייה בעומס מקבילי של שישים וארבעה תהליכים. המספרים האלה מראים שהוא שומר על קצב קבלה יציב של טוקנים גם בקונטקסט ארוך שמגיע לשלושים ושניים אלף טוקנים, במיוחד במשימות מובנות כמו מתמטיקה וחילוץ מידע.

מתאים ל

  • חילוץ מידע מתמונות ומסמכים

    מערך הראייה וההקשר העצום מאפשרים ניתוח מדויק של קלטים ויזואליים מורכבים וטבלאות בלי לחנוק את החומרה.

  • סוכני קוד ופיתוח אוטונומי

    קצב הדגימה הגבוה במשימות טכניות לצד הסרת הסירובים מונעים תקיעות מיותרות באמצע כתיבת סקריפטים.

  • ניתוח טקסטים ארוכים במיוחד

    חלון הקשר של מאתיים שישים ושניים אלף טוקנים מתמודד בקלות עם ספריות קוד ומסמכים משפטיים כבדים.

איפה זה נופל

המודל מגיע אחרי תהליך הסרת צנזורה אגרסיבי שמביא שיעור סירוב של חמישה מתוך מאה, מה שאומר שהוא יפלוט תוכן רעיל או בעייתי בלי מחסומים כמעט. אסור להוציא אותו למשתמשי קצה בלי שכבת סינון ובקרה חיצונית משלכם. בנוסף, הוא סבל מבאג במבנה הטנסורים שגרם לו לפלוט סימני קריאה על כל קלט תמונה, תקלה שתוקנה רק בקבצים שעודכנו מאוחר יותר. יש גם צניחה ברורה בקצב העיבוד בעבודה על טקסט חופשי ויצירתי, שם מנגנון הניחוש מקבל פחות טוקנים בהשוואה למשימות קוד ומתמטיקה.

שאלות
נפוצות

האם המודל יעבוד טוב על כרטיסי מסך מהדורות הקודמים?

הוא נארז בפורמט NVFP4 שדורש ליבות טנזור ייעודיות שקיימות בארכיטקטורת Blackwell. על כרטיסים ישנים יותר הביצועים יהיו גרועים או שהטעינה תיכשל, ולכן אין טעם להוריד אותו ללא החומרה המתאימה.

איך מוודאים שיכולת הראייה עובדת ולא פולטת זבל?

הגרסאות המוקדמות סבלו משמות טנסורים שגרמו לדילוג על רכיב התמונה ולפליטת סימני קריאה. יש לוודא שמשתמשים בקבצים המעודכנים שבהם הטנסורים תחת נתיב הראייה התקין ובתמונת vLLM המומלצת.

איך מריצים

כדי להריץ אותו צריך חומרה עם תמיכה ישירה בחישובי FP4, בדגש על שרתי DGX Spark וארכיטקטורת Blackwell SM 12.0 ומעלה. המשקל הכולל יושב על כעשרים ושניים גיגה בייט, אבל בעבודה עם מודל טיוטה והקשר רחב מומלץ להגביל את ניצול הזיכרון לשבעים אחוז כדי למנוע קריסות של הזיכרון המאוחד מול המעבד.

ההרצה מתבצעת דרך תמונת הקונטיינר הייעודית של vLLM בגרסה אפס נקודה עשרים ושלוש, יחד עם מודל הטיוטה z-lab להאצה. אם אין לכם גישה למעבדי הדור הזה, עדיף לא לנסות להרים את הגרסה הזו מקומית כי היא פשוט לא תנצל את היתרונות של הפורמט ותעבוד לאט מאוד, אם בכלל.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="AEON-7/Qwen3.6-35B-A3B-heretic-NVFP4")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון אפאצ'י שתיים נקודה אפס המאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה חוזרת. אתם יכולים לשלב אותו במוצרים פנימיים או מסחריים בלי תמלוגים, כל עוד אתם שומרים על הודעות זכויות היוצרים והרישיון המקוריות בקוד ובקבצים שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗