GPT
Q

qwen3-8b-heretic

קוד פתוח

DreamFastapache-2.02026-03-20

  • transformers
  • safetensors
  • gguf
  • qwen3
  • text-generation

גרסה נטולת צנזורה של מודל שמונה מיליארד פרמטרים, שמיועדת בעיקר לשמש כמקודד טקסט למודלי תמונה. היא פותרת את בעיית הסירובים העיקשת בלי לפרק את היכולת הלשונית.

  • 8.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 122 GBמשקל הקבצים
  • 5,694הורדות בחודש

מה זה

מדובר בהתאמה של Qwen3-8B שעברה תהליך הסרת עכבות באמצעות Heretic. היוצרים הריצו 3000 ניסיונות ובחרו בגרסה שהורידה את שיעור הסירובים מ־100 מתוך 100 ל־13 בלבד, תוך שמירה על סטיית KL נמוכה של 0.0838. בפועל זה אומר שהמודל מפסיק להטיף מוסר על בקשות מורכבות, אבל לא איבד את הצפון ולא מייצר ג'יבריש במקום שפה.

הייעוד המרכזי פה אינו שיחה כללית אלא תמיכה במודל יצירת התמונות Klein 9B בתוך ComfyUI. היוצרים ארזו מראש קבצים בשיטות כימות מתקדמות כמו FP8, INT4 ו־NVFP4 עם עיגול מונחה SVD, כך שהפגיעה באיכות הקידוד מינימלית ביחס לכימות רגיל.

מתאים ל

  • קידוד טקסט ל־Klein 9B

    מטפל בתיאורי תמונה חופשיים בלי לחסום פרומפטים בתוך ComfyUI.

  • הרצה מקומית ב־llama.cpp

    גרסת Q4_K_M של 5 גיגה מאפשרת שימוש עצמאי על חומרה צנועה.

  • מערכי בדיקות ללא סינון

    מאפשר לבחון שאילתות קצה שבדרך כלל נחסמות על ידי מודלים מסחריים.

איפה זה נופל

ההליך שעבר המודל לא מוחק סירובים לחלוטין. במבחן של היוצרים הוא עדיין סירב ל־13 מתוך 100 בקשות, כך שאי אפשר לבנות עליו לחופש מוחלט. בנוסף, הוא סוחב איתו את כל מגבלות הבסיס של Qwen3-8B. מי שינסה להריץ את גרסאות ה־NVFP4 על חומרה שאינה Blackwell יחווה פגיעה במהירות בגלל פענוח תוכנתי.

שאלות
נפוצות

האם המודל עובד בעברית?

הכרטיס מגדיר תמיכה באנגלית בלבד. אף על פי שדגמי Qwen כוללים לרוב יכולת רב־לשונית מסוימת, כאן לא נבדקה עברית ואין הבטחה לאיכות סבירה.

למה להעדיף אותו על פני מודל המקור?

אם נתקלתם בחסימות תכופות כשניסיתם לייצר תמונות דרך Klein 9B, הגרסה הזו פותרת את רוב המחסומים בלי להרוס את הבנת הפרומפט.

איך מריצים

בפורמט המקורי נדרשים כ־16 גיגה זיכרון כרטיס מסך, מה שמחייב חומרה מקצועית או כרטיס חזק. בשימוש מעשי רוב האנשים יורידו את גרסאות ה־GGUF או קובצי ה־ComfyUI. גרסת Q4_K_M שוקלת 5.0 גיגה בלבד ורצה בלי בעיה על מחשב אישי סביר עם llama.cpp.

עבור ComfyUI, קובץ ה־FP8 שוקל 8.8 גיגה ומתאים לכרטיסי Ada ו־Hopper, בעוד גרסאות NVFP4 ו־MXFP8 נותנות ביצועים מיטביים על ארכיטקטורת Blackwell החדשה, אף שהן עובדות בדה־כימות תוכנתי גם על כרטיס כמו RTX 4090.

ollama run hf.co/DreamFast/qwen3-8b-heretic:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ ברישיון Apache 2.0 מלא, בדיוק כמו מודל המקור. הרישיון מתיר שימוש מסחרי, שינוי קוד והפצה מחדש בלי תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗