GPT
Q

Qwen3.6-27B-AEON-Ultimate-Uncensored-NVFP4

קוד פתוח

AEON-7apache-2.02026-04-24

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • abliterated

גרסה מכווצת ומבוטלת סינונים למודל של עליבאבא, שתופסת 26 גיגה ומיועדת למי שצריך תגובות ישירות בלי מנגנוני סירוב על חומרה חדשה.

  • 19Bפרמטרים
  • 262,144טוקנים בהקשר
  • 25.8 GBמשקל הקבצים
  • 12,981הורדות בחודש

מה זה

הבסיס מגיע מתוך סדרת Qwen של עליבאבא ועבר הסרת מגבלות סירוב, כך שהוא אמור לענות לכל בקשה בלי לחסום. המפתחים השתמשו בכיול NVFP4 תוך שמירה על שכבות הראייה ושכבות הלינאריות בפורמט BF16 מלא, מה שמבטיח יכולת עיבוד של טקסט ותמונות בלי איבוד יכולות הראייה.

בגודל הזה של 19 מיליארד פרמטרים, המעבר לפורמט הדחוס חתך את המשקל מ־51 גיגה ל־26 גיגה, עם מרחק KL צפוי של מתחת ל־0.001 לעומת מקור ה־BF16. זה אומר שהפגיעה באיכות המקורית אפסית, תוך שמירה על חלון הקשר עצום של 262,144 טוקנים ויכולת קריאת תמונות וסרטונים.

מתאים ל

  • הרצת סוכנים וכלי קוד

    מגיע לקצב של 91 טוקנים לשנייה בבחירה דטרמיניסטית וכולל תמיכה מובנית בחלוקת קריאות לכלי קוד.

  • עיבוד מסמכים ותמונות

    מנתח טקסטים ארוכים במיוחד של 256K טוקנים לצד קלט חזותי מלא בלי ששכבות התמונה עברו כיווץ הרסני.

  • יצירת תוכן ללא חסימות

    עונה ללא התנגדות מובנית ומתאים למחקר או תסריטים שבהם מודלים מסחריים רגילים נוטים לסרב.

איפה זה נופל

הכרטיס מדגיש ששיעור הסירוב ירד לאפס במקור, אבל מציין מפורשות שצריך לאמת את זה מחדש אחרי הפריסה של הגרסה המכווצת. חוץ מזה, בהרצה על מחשבי Spark עם זיכרון משותף, אסור להעלות את ניצול הזיכרון מעל 0.7 כדי לא להפיל את המערכת, וההאצה הדרמטית של מודל הדגימה מתרסקת אם מייצרים טקסט עם טמפרטורה שמעל 0.7.

שאלות
נפוצות

אפשר להריץ את המודל על כרטיסי A100 או H100?

טכנית כן, כי הספריות יבצעו המרה בזמן אמת, אבל תקבלו ביצועים גרועים. המודל מיועד לחומרת Blackwell עם תמיכה פנימית ב־FP4, ועל שרתים ישנים יותר מומלץ להריץ את גרסת ה־BF16 המקורית.

האם פענוח תמונות נפגע בגלל הכיווץ?

לא. תהליך הדחיסה החריג לחלוטין את מגדל הראייה והשאיר אותו בפורמט BF16 מקורי, כך שיכולות ניתוח התמונה והווידאו של המודל נשארו שלמות.

איך מגיעים לקצב הפקת הטקסט המקסימלי?

מריצים דרך קונטיינר ה־vLLM הייעודי של הפרויקט עם מנוע הדגימה DFlash ומגדירים טמפרטורה 0. במצב הזה מקבלים כ־91 טוקנים לשנייה, בעוד שדגימה יצירתית מורידה את הקצב לכ־38 טוקנים לשנייה.

איך מריצים

המודל הזה נבנה ספציפית למאיצי הדור החדש של אנבידיה בארכיטקטורת בלקוול, כמו DGX Spark או כרטיסי B100 ו־B200, שמסוגלים לחשב FP4 באופן מובנה בחומרה. מריצים אותו דרך קונטיינר ייעודי של vLLM, שם הוא מגיע לכ־91 טוקנים לשנייה בדגימת greedy בעזרת מאיץ דגימה DFlash, לעומת כ־38 טוקנים לשנייה בדגימה יצירתית חמה יותר.

אם אתם על A100 או H100, אל תורידו את הגרסה הזאת. הדורות האלה לא תומכים בהאצת FP4 בחומרה אלא ממירים אותו חזרה בזמן אמת, ועדיף להריץ עליהם את גרסת ה־BF16 המלאה או להשתמש ב־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="AEON-7/Qwen3.6-27B-AEON-Ultimate-Uncensored-NVFP4")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המקורי של Qwen, שמאפשר שימוש מסחרי, שינוי והפצה חופשית. למרות זאת, היוצרים הוסיפו תנאי שימוש נוקשים שמטילים עליכם אחריות משפטית מלאה על כל פלט, דורשים שכבת הגנה חיצונית, ומחייבים בוררות אישית במקרה של תביעה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗