GPT
Q

Qwen3.6-35B-A3B-Uncensored-Heretic-MLX-4bit

קוד פתוח

froggericapache-2.02026-04-27

  • mlx
  • safetensors
  • qwen3_5_moe
  • mlx-lm
  • mlx-vlm

גרסת 4 ביט לסביבת אפל סיליקון של מודל מולטימודלי עם הסרת סינונים מותאמת ארכיטקטורה. הוא מיועד למי שרוצה הרצה מקומית של חשיבה וראייה ממוחשבת בלי סירובים מיותרים ובלי תקלות תבנית.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.0 GBמשקל הקבצים
  • 11,476הורדות בחודש

מה זה

מדובר בהמרה לספריית MLX של מודל תערובת מומחים עם 35 מיליארד פרמטרים בסך הכול, שמפעיל בפועל רק כשלושה מיליארד בכל טוקן. המודל מקבל טקסט, תמונות ווידאו, ומכיל מנגנון חשיבה מובנה שאפשר לכבות ולהדליק לפי הצורך. הייחוד העיקרי כאן הוא הסרת הסינון שבוצעה באמצעות כלי בשם Heretic, תוך התחשבות בארכיטקטורה ההיברידית שמשלבת קשב ליניארי וקשב קלאסי ביחס של שלוש לאחת.

במקום למחוק סירובים בצורה עיוורת בכל השכבות, בוצעה כאן התאמת פרמטרים נפרדת לכל סוג קשב. התוצאה היא ירידה מ־83 סירובים ל־10 במבחן של מאה שאלות, עם מרחק KL של 0.0015 בלבד מול מודל המקור. ציוני MMLU כמעט לא זזו, מ־83.72 אחוז במקור ל־83.30 אחוז כאן, מה שאומר שהיכולות הכלליות לא נשחקו בתהליך. בנוסף, ההמרה הזו מתקנת 333 מפתחות פגומים בחלק של הראייה הממוחשבת ומסדרת את תבנית השיחה לריצה תקינה בסביבות C++.

מתאים ל

  • ניתוח תמונות ווידאו ללא צנזורה

    תיקון מפתחות הראייה מאפשר ניתוח ויזואלי ישיר על מק מקומי, בלי סירובי מערכת גנריים על תוכן רגיש.

  • פיתוח קוד עם חשיבה עמוקה

    הפעלת תגית החשיבה מייצרת תהליך פתרון מפורט למשימות תכנות, תוך שמירה על ביצועי מודל כמעט זהים למקור.

  • הפעלת פונקציות בתוכנות C++

    תבנית השיחה המתוקנת מונעת קריסות בקריאות לכלים בסביבות כמו LM Studio ומאפשרת שימוש באוטומציות.

איפה זה נופל

החולשה העיקרית היא תלות נוקשה בהנחיית מערכת ספציפית. השורה הראשונה חייבת להיות הצהרה שהמודל הוא Qwen מבית עליבאבא קלאוד, אחרת הביצועים שלו מתדרדרים. במצב חשיבה ממושך נדרש להקצות לפחות 128 אלף טוקנים בזיכרון, מה שמכביד מאוד על החומרה. מעבר לכך, למרות הסרת הסירובים עדיין נמדדו 10 סירובים מתוך 100, כך שההסרה אינה מוחלטת.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

המודל תומך בריבוי שפות מהאימון המקורי, אך המיקוד של הפרויקט הוא אנגלית וסינית. הוא מסוגל לעבד עברית ברמה מסוימת, אבל במשימות חשיבה מורכבות עדיף לעבוד באנגלית כדי להימנע מטעויות.

איך מכבים את שלב החשיבה כדי לקבל תשובות מהירות?

שולחים את התגית הייעודית כחלק מהטקסט בהודעת המערכת או המשתמש. תבנית השיחה מזהה את התגית, מוחקת אותה מהקלט ומעבירה את המודל למענה ישיר ומהיר ללא נימוקים.

איך מריצים

ההרצה נעשית ישירות דרך חבילות mlx-lm או mlx-vlm בפייתון, או בתוכנות כמו LM Studio על גבי מק. הקבצים שוקלים 19 גיגהבייט, וכדי להריץ אותם נדרש מחשב עם 24 גיגהבייט זיכרון אחוד לפחות. יש גם גרסאות 6 ביט ו־8 ביט לאותו מודל, שמציעות דיוק גבוה יותר אבל דורשות משמעותית יותר זיכרון.

אם אין לכם חומרת אפל סיליקון עם הזיכרון המתאים, אין מה לחפש כאן כי הפורמט הזה לא יעבוד על כרטיסי אנבידיה. במצב כזה עדיף לקרוא ל־API חיצוני או לחפש המרות GGUF של דגם המקור.

pip install -U huggingface_hub
hf download froggeric/Qwen3.6-35B-A3B-Uncensored-Heretic-MLX-4bit

הרישיון

הרישיון הוא Apache 2.0 המקורי. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולהפיץ אותו בחופשיות. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗