GPT
M

mlabonne_Qwen3-14B-abliterated-GGUF

קוד פתוח

bartowskiapache-2.02025-04-29

  • gguf
  • abliteration
  • abliterated
  • text-generation
  • endpoints_compatible

גרסה מכווצת של מודל 14B שעבר הסרת מגבלות בטיחות, מוכנה להרצה מקומית דרך llama.cpp. היא מתאימה למי שצריך מודל שלא מסרב לפקודות ויכול להיכנס לכרטיס מסך בודד.

  • 219 GBמשקל הקבצים
  • 13,871הורדות בחודש
  • 39לייקים

מה זה

מדובר במארז קבצי GGUF של המודל מבית mlabonne, שהתבסס על ארכיטקטורת Qwen3 בגודל 14 מיליארד פרמטרים ועבר תהליך של הסרת מנגנוני הסירוב והסינון המובנים. המפתח bartowski יצר את כל גרסאות הכימות כאן באמצעות imatrix ודאטהסט כיול ייעודי, מה שמצמצם את אובדן הדיוק במעבר למספרים קטנים יותר.

המודל מיועד בעיקר למשימות של יצירת טקסט שבהן מודלים מסחריים רגילים נוטים לצנזר את עצמם או להטיף מוסר. המבחנים בכרטיס המודל מראים ביצועים על מעבדי EPYC עם טכנולוגיית פריקה מחדש בזמן ריצה, שמספקת עבודה מהירה יותר בעיבוד הפרומפט הראשוני וקצב יצירת טקסט סביר על מעבדי שרתים רגילים.

מתאים ל

  • ניתוח טקסטים ללא צנזורה

    מתאים לסריקת מסמכים רגישים או חקירת תוכן שהיה גורם למודלים אחרים לסרב לפקודה.

  • סוכן כתיבה אוטונומי

    משתלב בצינורות עבודה מקומיים שבהם נדרשת יצירת טקסט ישירה ועקבית ללא הטפות מוסר באמצע הריצה.

  • בדיקות אבטחת מידע

    משרת תרחישי בדיקות חדירה וסימולציות תקיפה שבהם בוחנים תגובות של מערכות לתוכן לא מסונן.

איפה זה נופל

ההסרה של מנגנוני הסירוב אומרת שהמודל מייצר פלטים בלי שום מסננת מובנית. הוא עלול לפלוט מידע שגוי, תוכן בעייתי או הזיות בלי אזהרה, ולכן אסור לחשוף אותו ישירות למשתמשי קצה בלי שכבת בדיקה משלכם. בנוסף, גרסאות הכיווץ הנמוכות מתחת ל־Q3 מאבדות מאיכות ההיגיון והתחביר, והן מוגדרות מראש כבעלות איכות נמוכה.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

עבור רוב השימושים כדאי לבחור ב־Q4_K_M ששוקל 9 גיגה ומציע איזון מעולה בין איכות לנפח. אם יש לכם מספיק זיכרון בכרטיס המסך, גרסת Q6_K בגודל של כ־12.1 גיגה תיתן תוצאות קרובות מאוד למקור.

האם המודל דורש חיבור לרשת בזמן העבודה?

לא. ברגע שהורדתם את קובץ ה־GGUF למחשב, הריצה מתבצעת באופן מקומי לחלוטין דרך llama.cpp או LM Studio, ללא שליחת מידע לשרתים חיצוניים.

איך מריצים

אתם מורידים קובץ בודד בהתאם לזיכרון שיש לכם, ומריצים אותו ישירות בתוכנות כמו LM Studio או בספריית llama.cpp לפי תבנית הפרומפט הייעודית של המודל. כדי לקבל ביצועים מהירים באמת, עדיף להכניס את כל המשקל לזיכרון כרטיס המסך, כלומר קובץ שקטן בלפחות גיגה או שניים מנפח ה־VRAM הכולל.

למשל, גרסת Q4_K_M שוקלת 9 גיגה ותעבוד היטב על כרטיס של 12 או 16 גיגה, בעוד גרסאות כמו Q8_0 דורשות כמעט 16 גיגה לקובץ בלבד. אם יש לכם מעבד ARM או חומרה חלשה יותר בלי כרטיס גרפי תואם, אפשר לבחור בגרסאות מכווצות במיוחד מסדרת IQ, אבל שם קצב הפקת הטקסט יירד משמעותית.

ollama run hf.co/bartowski/mlabonne_Qwen3-14B-abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני מאוד. הוא מאפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, והוא מסיר אחריות משפטית מיוצרי המודל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗