GPT
Q

Qwen3.8-27B-Uncensored-YMQ-MTP-GGUF

קוד פתוח

zerodigestapache-2.02026-08-15

  • gguf
  • text-generation
  • quantizer
  • autoround
  • architecture-aware

גרסת קוונטיזציה לא מצונזרת עם ארכיטקטורה מעורבת של 27B פרמטרים. היא נבנתה במיוחד למפתחים שרוצים להריץ סוכני קוד מקומיים על כרטיסי מסך צרכניים בלי סירובים מיותרים.

  • 134 GBמשקל הקבצים
  • 156,553הורדות בחודש
  • 95לייקים

מה זה

הפרויקט הזה לוקח את משקלי המקור הלא מצונזרים וממיר אותם לפורמט GGUF בעזרת מהדר ייעודי. במקום לחתוך את כל השכבות לאותה רמת דיוק, הוא משאיר שכבות קריטיות בדיוק גבוה ומכווץ שכבות משניות. המטרה היא לאפשר הרצה מקומית של מודל גדול יחסית לצד סביבות פיתוח כמו RooCode או Aider, עם תמיכה בניבוי מקבילי מובנה.

מבחני הבלבול מראים שגרסת M מקבלת ציון של 6.8176, שמקביל כמעט לחלוטין לגרסת ה־XL ששוקלת 19 גיגהבייט. ההסרה של שכבות הסירוב מונעת קריסות היגיון, מה שמאפשר לו להחזיק מעמד במשימות ניתוח קוד ארוכות בלי לבזבז זיכרון על שכבות בטיחות מלאכותיות.

מתאים ל

  • סוכן כתיבת קוד מקומי

    חיבור ישיר לכלים כמו Aider לכתיבה ותיקון שגיאות בקוד ללא צנזורה ועם חלון הקשר נרחב.

  • פיתוח על כרטיס 16GB

    הרצת מודל 27B על מחשב פיתוח יחיד תוך שמירה על כמה גיגהבייט פנויים לטובת זיכרון ההקשר.

  • ניתוח תמונות בקוד פתוח

    הרחבה למודל רב מודאלי באמצעות הוספת קובץ mmproj מתאים לניתוח צילומי מסך ומסמכים.

איפה זה נופל

בגרסאות המכווצות ביותר, כמו XXS-Pro, הדחיסה האגרסיבית פוגעת במבנה הלוגי. הכרטיס מודה בפירוש שבתהליכי עבודה עמוקים של סוכני קוד, המודל עלול לסבול מאובדן הקשר ולולאות עיצוב. הוא גם נטול מנגנוני בטיחות וסירוב, מה שהופך אותו לבעייתי בסביבות ייצור שחשופות למשתמשי קצה לא מנוטרים.

שאלות
נפוצות

האם גרסת XXS מתאימה לעבודה רציפה על קוד?

לא מומלץ. הרמות האלה נועדו בעיקר לבדיקות או פקודות בודדות. כמות הרעש מהדחיסה גורמת לו לאבד את ההקשר במשימות רב שלביות.

איזו גרסה מומלצת אם יש לי כרטיס מסך של 16GB?

גרסת S-Pro או M-TI תתאים בדיוק. הן יושבות על כ־12.5 גיגהבייט, שומרות על רמת דיוק טובה בהיגיון הלוגי, ומשאירות מקום לזיכרון הריצה.

האם המודל יסרב לבצע בקשות מסוימות?

לא. מדובר בגרסה לא מצונזרת שעברה הסרה של שכבות הסירוב, כך שהוא מייצר פלט ישיר לכל הנחיה בלי חסימות מערכת.

איך מריצים

מריצים אותו ישירות דרך llama.cpp או llama-server עם דגלים לתמיכה בהקשר ארוך וחיזוי מקבילי. מי שרוצה יכול לחבר גם קובץ ראייה תואם כדי להוסיף יכולות ניתוח תמונה.

הקבצים מתחילים בגרסאות מכווצות של 9.3 גיגהבייט שנדחסות לכרטיסי 12 גיגהבייט, ומגיעים עד גרסאות מלאות של 19 גיגהבייט שדורשות כרטיס של 24 גיגהבייט. לרוב המפתחים גרסת M-TI או S-Pro על גבי כרטיס של 16 גיגהבייט תיתן את האיזון הטוב ביותר בין ביצועים לשטח פנוי בזיכרון, בלי להזדקק לשרת מרוחק.

ollama run hf.co/zerodigest/Qwen3.8-27B-Uncensored-YMQ-MTP-GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗