GPT
Q

Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-Preserved-APEX-GGUF

קוד פתוח

SC117apache-2.02026-05-26

  • transformers
  • gguf
  • qwen3_5_moe
  • qwen3_5
  • heretic

גרסת קוונטיזציה מיוחדת של מודל מומחים שעבר הסרת סינונים כמעט מלאה. תקבלו כאן מודל קל יחסית שמסרב הרבה פחות ומנצל מנגנון חיזוי מהיר.

  • 76.1 GBמשקל הקבצים
  • 68,032הורדות בחודש
  • 120לייקים

מה זה

מדובר בהמרה בפורמט GGUF של מודל מבוסס Mixture of Experts בעל 35 מיליארד פרמטרים כוללים, אך רק 3 מיליארד מתוכם פעילים בכל טוקן נתון, מתוך 256 מומחים שונים. הבסיס עבר תהליך הסרת סינונים באמצעות Heretic ושיטת MPOA, מה שהוריד את כמות הסירובים מ־83 מתוך 100 ל־10 בלבד, תוך שמירה על דיוק קרוב מאוד למקור עם מדד שונות של 0.0015 KL.

הייחוד בגרסה הזו הוא שיטת הקוונטיזציה APEX, שמקצה דיוק שונה לשכבות הקריטיות לעומת השכבות הפנימיות. לפי המדידות, גרסאות APEX משיגות ציון של מעל 83% בבנצ'מרק HellaSwag ומדדי Perplexity שמתחרים בגרסת ה־F16 המלאה, תוך חיתוך משמעותי במשקל ובמהירויות שנעות בין 61 ל־69 טוקנים לשנייה. בנוסף, נשמרו שכבות ה־MTP שמאפשרות שימוש בפיענוח ספקולטיבי שמאיץ את הפעולה.

מתאים ל

  • פיתוח וכתיבת קוד

    ארכיטקטורת מומחים קלה ומהירה שמגיבה היטב להנחיות תכנות ומאפשרת שימוש בפרמטרים מותאמים לקוד.

  • בדיקות חוסן ואבטחה

    היעדר הסינונים מאפשר לבדוק תרחישי קיצון ופגיעויות בלי להיתקל בחסימות סירוב גנריות של מודלים סגורים.

  • עבודה מקומית ללא רשת

    משקל קובץ שמתחיל מ־15.85 ג'יגה בייט מאפשר פריסה עצמאית לחלוטין על מחשב ייעודי ללא תלות בענן.

איפה זה נופל

הורדת הסינונים חדה מאוד, מה שאומר שהמודל ייצר תכנים בוטים, פוגעניים או שגויים ללא מעצורים אם תבקשו זאת, ולכן אסור לחבר אותו למוצר צרכני ללא שכבת סינון נפרדת. בנוסף, הביצועים והמהירויות שנמדדו בדף המודל נבדקו על חומרת שרתים חזקה מאוד מסוג DGX Spark, ובמחשב פיתוח רגיל עם זיכרון משותף תרגישו ירידה משמעותית במהירות, במיוחד אם תנסו לנצל את מלוא חלון ההקשר.

שאלות
נפוצות

האם אני חייב להפעיל את ה־MTP כדי שהמודל יעבוד?

לא, המודל יעבוד כרגיל גם בלי ההגדרות האלה. יחד עם זאת, הפעלת הדגלים המתאימים ב־llama.cpp תיתן לכם תוספת מהירות של 20 עד 50 אחוזים בזכות פיענוח ספקולטיבי מובנה.

באיזו גרסה מתוך השלוש כדאי לי לבחור?

אם יש לכם כרטיס עם 24 ג'יגה בייט VRAM ומעלה, גרסת Balanced במשקל 24.18 ג'יגה בייט תיתן את האיזון הטוב ביותר בין מהירות לדיוק. אם הזיכרון שלכם גבולי, קחו את Compact ששוקלת 15.85 ג'יגה בייט.

איך מריצים

את המודל מריצים דרך llama.cpp או Ollama על גבי קובץ GGUF בודד שתבחרו. יש כאן שלוש גרסאות עיקריות, החל מגרסת Compact ששוקלת 15.85 ג'יגה בייט ומתאימה למי שמוגבל בזיכרון, דרך Quality בנפח 21.90 ג'יגה בייט, ועד Balanced ששוקלת 24.18 ג'יגה בייט ומוגדרת כמומלצת ביותר.

כדי להריץ את גרסת Balanced בנוחות עם הקשר רחב תצטרכו כרטיס מסך עם 24 ג'יגה בייט VRAM לפחות, או לחלק שכבות בין הזיכרון הגרפי למעבד. עם דגלי MTP מופעלים תקבלו בוסט של 20 עד 50 אחוז במהירות הריצה. אם אין לכם חומרה ייעודית מקומית, עדיף להשתמש ב־API חיצוני של שרתי ענן במקום להילחם בזמני תגובה איטיים במחשב האישי.

ollama run hf.co/SC117/Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-Preserved-APEX-GGUF:Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-Preserved-APEX-I-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המקורי. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה של המשקלים והקוד, ללא תשלום תמלוגים, כל עוד מצרפים את תנאי הרישיון המקורי וכתב הוויתור על אחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗