GPT
Q

Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-Preserved-GGUF

קוד פתוח

llmfan46apache-2.02026-05-08

  • transformers
  • gguf
  • qwen3_5_moe
  • qwen3_5
  • heretic

גרסת GGUF שעברה הסרת צנזורה למודל משולב תמונה וטקסט, המפעיל רק שלושה מיליארד פרמטרים בכל שלב. הוא עונה בלי לחסום בקשות שנויות במחלוקת ומציע יכולות תכנות חזקות.

  • 249 GBמשקל הקבצים
  • 46,769הורדות בחודש
  • 141לייקים

מה זה

מדובר במודל שפה וראייה ממשפחת Qwen3.6 שמכיל 35 מיליארד פרמטרים בסך הכל, אך בזכות ארכיטקטורת תערובת מומחים מפעיל רק 3 מיליארד בכל רגע. היוצר llmfan46 העביר אותו תהליך ביטול צנזורה באמצעות כלי בשם Heretic, במטרה למנוע ממנו לסרב להוראות או להטיף מוסר למשתמשים. במבחן הסירובים המדווח בכרטיס, המודל המקורי דחה 83 מתוך 100 פניות, בעוד הגרסה הזו דחתה רק 10.

בבדיקות הבנצ'מרק של MMLU, הדיוק הכללי נשמר כמעט לחלוטין: 83.39% לעומת 83.71% במקור, עם מדד מרחק KL מזערי של 0.0015. הדבר מראה שהסרת מנגנוני הבטיחות לא פגעה ביכולת ההסקה הכללית. בנוסף, המודל המקורי הציג שיפור ניכר במשימות קוד וסוכני פיתוח, עם ציון של 73.4 בבחינת SWE-bench Verified וחלון הקשר בסיסי של 262,144 תווים.

מתאים ל

  • סוכן לפיתוח תוכנה

    משיג תוצאה של 73.4 ב־SWE-bench ומציע יכולות ניתוח ריפו בלי סירובים על קוד אבטחה.

  • מחקר ואבטחת מידע

    דוחה רק 10 מתוך 100 פניות ומאפשר לבחון תרחישי תקיפה ובדיקות חדירות ללא חסימות.

  • ניתוח תמונות ומסמכים

    משלב מודל ראייה עם חלון הקשר עצום של 262,144 תווים להבנת טקסט ותמונות יחד.

איפה זה נופל

ההסרה של מנגנוני הסירוב משאירה את המודל ללא בלמים, ולכן הוא עלול לייצר פלטים בעייתיים או פוגעניים ללא אזהרה מוקדמת. לא הייתי משתמש בו לשירות לקוחות פתוח או למוצר ציבורי ללא שכבת סינון עצמאית. בנוסף, יש ירידה קלה בציונים בחלק מנושאי ה־MMLU ביחס למקור, ומשימות ראייה מחייבות טעינה נפרדת של קובץ הפרוג'קטור שעלולה לסבך את הצינור.

שאלות
נפוצות

האם המודל יפעל בלי קובץ הראייה?

הוא יעבוד עבור טקסט בלבד. אם רוצים להזין תמונות לתוך השיחה, חובה לטעון לצדו את הקובץ Qwen3.6-35B-A3B-mmproj-BF16.gguf.

במה הגרסה הזו שונה מ־Qwen המקורי?

עברו עליה אלגוריתמים שהסירו את שכבות הסירוב הפנימיות. היא דוחה רק 10 מתוך 100 פניות במקום 83 במודל המקורי, תוך שמירה על דיוק דומה.

האם אפשר להריץ אותו על מחשב ביתי ממוצע?

במשקלים הנמוכים כמו Q3 או Q4 אפשר להריץ אותו, אך עדיין מדובר ב־35 מיליארד פרמטרים בסך הכל. כרטיס מסך עם זיכרון נמוך יתקשה להחזיק אותו בקצב מהיר.

איך מריצים

כדי להריץ אותו מקומית מורידים את קובץ ה־GGUF ברמת הקוונטיזציה הרצויה יחד עם קובץ ה־Vision Projector הייעודי, שנחוץ בשביל יכולות התמונה. הכלי עובד מול llama.cpp, LM Studio ו־Ollama, כאשר קוונטים כמו Q4_K_M או Q5_K_M ידרשו פחות זיכרון גרפי, ואילו Q8_0 יספק איכות מקסימלית אך ידרוש כרטיס עם זיכרון גדול בהרבה.

בסך הכל המאגר כולל 249 GB המחולקים ל־12 קבצים שונים. אם אין ברשותכם חומרה ייעודית עם מספיק VRAM להחזיק מודל של 35 מיליארד פרמטרים, פנייה ל־API מנוהל של המודל המקורי תהיה פשוטה וזולה יותר, אך תאבד את היתרון של הסרת הצנזורה המקומית.

ollama run hf.co/llmfan46/Qwen3.6-35B-A3B-uncensored-heretic-Native-MTP-Preserved-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מדווח תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי קוד והפצה חופשית, בתנאי ששומרים על הודעות זכויות היוצרים וההצהרה המקורית. אפשר לשלב אותו במוצר מסחרי בלי לשלם תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗