GPT
O

Ornith-1.0-35B-AEON-Ultimate-Uncensored-NVFP4

קוד פתוח

AEON-7mit2026-06-27

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • abliterated

גרסת קוונטיזציה של 4 ביט למודל קוד וסוכנים ללא מנגנוני סירוב, שמיועדת לחומרת בלקוול של אנבידיה. תקבלו כאן מודל שמציית לכל פקודה ושוקל כשליש מהמקור.

  • 21Bפרמטרים
  • 262,144טוקנים בהקשר
  • 22.1 GBמשקל הקבצים
  • 3,491הורדות בחודש

מה זה

המודל הזה הוא גרסה מכווצת של Ornith 1.0 35B, מודל תערובת מומחים שמבוסס במקור על אימון המשך של Qwen3.6-35B-A3B. יוצרי הגרסה הסירו ממנו לחלוטין את מנגנוני הסירוב וההטפה, ואז דחסו אותו לפורמט NVFP4 תוך שמירה על שכבות הקשב, הראייה וההסקה ברמת דיוק מלאה של BF16. הדחיסה נעשתה רק על משקלי המומחים, כך שהאקטיבציות נשארות רחבות ונמנעת הנפילה הרגילה בביצועים שמאפיינת קוונטיזציה כבדה.

בבדיקות של 18 משימות קוד וסוכנים, המודל שמר על ציון זהה למקור של 0.833, לצד אפס סירובים על בקשות שנבדקו. הוא מציג מהירות תגובה ראשונית מהירה פי שלושה ביחס לגרסת הדיוק המלא, וקצב ייצור הטוקנים עולה עד 73.8 טוקנים לשנייה למשתמש בודד כשמשלבים מפענח ספקולטיבי מתאים.

מתאים ל

  • פיתוח סוכני קוד אוטונומיים

    מתאים לסביבות עבודה שדורשות קריאות כלים וכתיבת קוד ישירה מבלי להיתקל בסירובים על פקודות מערכת רגישות.

  • בדיקות אבטחה וחדירות

    מאפשר לייצר סקריפטים ובדיקות חולשה שמודלים מצונזרים רגילים מסרבים לכתוב.

  • הסקה מהירה בחומרת בלקוול

    מנצל את ארכיטקטורת ה־NVFP4 כדי לספק זמני תגובה קצרים במיוחד בשרתי הדור החדש.

איפה זה נופל

החיסרון המרכזי הוא החומרה הנדרשת, שכן ללא מעבדי בלקוול המודל חסר תועלת. מעבר לזה, המודל מייצר קוד ומפעיל כלים ללא שום מנגנון בטיחות פנימי, כך שאם תחברו אותו למערכת אוטונומית שמריצה פקודות ישירות, אתם חשופים להרצת קוד מזיק או שגוי בלי התרעה. בנוסף, בשימוש בהאצה ספקולטיבית על זיכרון אחוד יש מגבלת יציבות ברורה של עד 16 בקשות במקביל, ומעבר לכך המערכת קורסת מחוסר זיכרון.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי RTX 4090 או A100?

לא. המודל בנוי בפורמט NVFP4 שדורש חומרת אנבידיה מסדרת בלקוול, כמו B200 או שבבי GB10. על כרטיסים מדורות קודמים תצטרכו להשתמש בגרסת ה־BF16 המלאה.

האם הורדת הדיוק ל־4 ביט פגעה ביכולות התכנות שלו?

לפי בדיקות היוצרים על 18 משימות סוכנים וקוד, המודל שמר על דיוק זהה לחלוטין לגרסת המקור ללא פגיעה בביצועים. הסיבה לכך היא ששכבות הקשב וההסקה נשארו ב־BF16 ורק משקלי המומחים כווצו.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מארכיטקטורת בלקוול של אנבידיה, כמו B200 או מעבדי GB10, כי הפורמט הזה פשוט לא ירוץ על כרטיסים ישנים יותר. מריצים אותו דרך vLLM עם ספריית compressed-tensors, ומשקלו 23.7 גיגה בייט, כך שהוא נכנס בקלות לכרטיס בודד מהדור החדש.

אם אין לכם גישה למעבדי בלקוול, אין מה לנסות להריץ את הגרסה הזו ועדיף לפנות לגרסת ה־BF16 המקורית שדורשת כ־66 גיגה בייט זיכרון אך תואמת לחומרה רחבה יותר, או להשתמש ב־API מנוהל.

from transformers import pipeline

pipe = pipeline("text-generation", model="AEON-7/Ornith-1.0-35B-AEON-Ultimate-Uncensored-NVFP4")
print(pipe("שלום"))

הרישיון

הרישיון הוא MIT, מה שאומר שמותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולהפיץ אותו בחופשיות. עם זאת, היוצרים הוסיפו סעיפי אחריות ובוררות מחמירים שמעבירים את מלוא האחריות החוקית והנזקים על כתפי מי שמריץ את המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗