GPT
G

Goekdeniz-Guelmez_Josiefied-Qwen3-8B-abliterated-v1-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-05-05

  • gguf
  • chat
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF שעברה הסרת מגבלות על בסיס מודל 8B, מיועדת למי שרוצה הרצה מקומית בלי סינונים תאגידיים ובלי סירובים מיותרים. מתאימה למפתחים שצריכים שליטה מלאה בתשובות של המודל.

  • 121 GBמשקל הקבצים
  • 5,951הורדות בחודש
  • 37לייקים

מה זה

מדובר בהמרה של bartowski למודל Josiefied-Qwen3-8B שעבר תהליך abliteration, כלומר ניקוי של מנגנוני הסירוב וההטיה המובנים. המודל מתמקד ביצירת טקסט חופשי לפי פורמט הפרומפט המוכר של ChatML. כל הקבצים עברו כיול באמצעות imatrix, מה שמשפר את הדיוק של הקוונטיזציות הנמוכות ומקטין את איבוד המידע בהשוואה להמרות ישירות.

ההבדל המשמעותי בין המודל הזה לבין גרסאות בסיס רגילות בגודל 8B הוא הנכונות לענות על הוראות בלי לחסום פרומפטים רגישים. חלק מהגרסאות פה, כמו Q4_K_L או Q3_K_XL, שומרות על משקלי הקלט והפלט ברמת Q8_0 כדי למנוע הידרדרות באיכות השפה, עניין קריטי כשמנסים לחסוך מקום בלי לרסק את יכולת הניסוח.

מתאים ל

  • בדיקות חוסן ועקיפת הגנות

    מאפשר לבדוק תרחישי קצה ללא סירובים מובנים שקיימים במודלים רגילים.

  • הרצה מקומית על מחשב נייד

    גרסת Q4_K_M שוקלת 5.03GB ונכנסת בקלות לכרטיסי מסך ביתיים.

  • מחקר על התנהגות מודלים

    מתאים לניתוח השפעת ה־abliteration על פלט הטקסט ועל קוונטיזציות שונות.

איפה זה נופל

מודלים שעברו הסרת מגבלות נוטים לייצר תכנים בעייתיים בלי שום בלם, מה שאומר שכל מנגנון סינון או בטיחות שתרצו במוצר שלכם תצטרכו לבנות בעצמכם מסביב. בנוסף, מודל של שמונה מיליארד פרמטרים עדיין מוגבל ביכולות הסקה מורכבות, וקוונטיזציות נמוכות מאוד כמו IQ2_M ששוקלת 3.05GB פוגעות משמעותית בדיוק של התשובות ולא מתאימות למשימות שדורשות עקביות.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

עבור רוב השימושים, Q4_K_M בגודל 5.03GB נותן את האיזון הנכון בין גודל לאיכות פלט. אם יש לכם זיכרון פנוי בכרטיס המסך, קחו את Q6_K שמציע איכות קרובה מאוד למקור.

למה מופיעות גרסאות שמתחילות ב־IQ?

מדובר בשיטת קוונטיזציה שמיועדת למשקלים נמוכים מתחת לארבעה ביטים. הן עובדות מצוין על כרטיסי אנבידיה ו־AMD, אך עלולות לרוץ לאט יותר על מעבדים רגילים לעומת גרסאות K המקבילות.

איך מריצים

את הקבצים מריצים ישירות עם llama.cpp מגרסה b5270 ומעלה, או בתוכנות כמו LM Studio. כדי שהמודל ירוץ מהר, צריך להכניס את כולו לתוך הזיכרון של כרטיס המסך. לכרטיס עם 8GB זיכרון יתאים קובץ כמו Q4_K_M ששוקל 5.03GB או IQ4_XS ששוקל 4.56GB, ומשאיר מקום לקונטקסט. לכרטיסים של 12GB אפשר לקחת Q6_K ששוקל 6.73GB או Q8_0 שמגיע ל־8.71GB.

מי שאין לו כרטיס מסך ייעודי יכול להריץ על המעבד, כאשר גרסאות כמו Q4_0 או IQ4_NL תומכות בסידור זיכרון אוטומטי במעבדי ARM ו־AVX כדי לשפר מהירות. במחשבים ניידים של אפל, גרסת Q4_1 מציעה יעילות חשמלית טובה יותר. אם אין לכם לפחות 8GB פנויים במערכת, עדיף להשתמש בשירות מרוחק במקום להיאבק בזמני מענה ארוכים.

ollama run hf.co/bartowski/Goekdeniz-Guelmez_Josiefied-Qwen3-8B-abliterated-v1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

27 קבצים במאגר, 121 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

למודל הזה לא דווח רישיון במקור. בפועל, היעדר רישיון מוגדר יוצר סיכון משפטי ברור, כך שלא הייתי משלב אותו במוצר מסחרי או מפיץ אותו הלאה לפני שמבררים ישירות מול היוצר מה תנאי השימוש.

הרישיון המלא בעמוד המודל ↗