GPT
D

DeepSeek-R1-Distill-Qwen-32B-abliterated-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-01-25

  • gguf
  • abliterated
  • uncensored
  • text-generation
  • endpoints_compatible

גרסה מכווצת בפורמט GGUF למודל חשיבה מבוסס קוון בגודל 32 מיליארד פרמטרים, שעבר הסרה מכוונת של מנגנוני הסירוב והסינון כדי לענות על כל הנחיה ישירות וללא חסימות.

  • 483 GBמשקל הקבצים
  • 15,043הורדות בחודש
  • 167לייקים

מה זה

מדובר בהמרה של המודל שפורסם על ידי huihui-ai, אשר עבר תהליך הסרת עכבות כדי שלא יסרב לשאלות, וכאן bartowski ארז אותו באמצעות llama.cpp גרסה b4546 בכיול imatrix. הוא מיועד ליצירת טקסט וחשיבה מעמיקה, כשהבסיס הוא זיקוק הידע של סדרת R1 לתוך הארכיטקטורה של Qwen.

ההבדל המרכזי מול גרסאות רשמיות באותו גודל הוא הסרת מנגנוני ההגנה הפנימיים. המודל פשוט עונה, בלי לקטוע את השיחה בהטפות מוסר או בסירובים אוטומטיים. החבילה כוללת מגוון רחב של כיולים, החל מקבצים של 9.03 גיגה בייט בפורמט IQ2_XXS ועד למשקל מלא של 65.54 גיגה בייט בפורמט bf16.

מתאים ל

  • מחקר אבטחה ובדיקות חדירה

    ניתוח ותרחישי תקיפה ללא חסימות אוטומטיות של המודל.

  • סימולציות משחק ללא סינון

    כתיבת דיאלוגים חופשיים לדמויות קשוחות בלי התחסדות.

  • הרצה מקומית על כרטיס יחיד

    מודל חשיבה מתקדם שנכנס בכרטיס ביתי של 24 גיגה בייט.

איפה זה נופל

מודלים שעברו תהליך של הסרת הגנות נוטים לפעמים לחוסר יציבות בתשובות, והם מייצרים תכנים רגישים או שגויים בלי שום אזהרה מוקדמת. מעבר לכך, כיולים נמוכים של 2 ביט מאבדים חלק ניכר מיכולת ההיגיון המקורית של המודל, ובפורמטים מסוימים כמו IQ יש בעיות תאימות מול מנועי ריצה מבוססי Vulkan. חובה לבדוק היטב את תקינות הפלטים לפני שמשלבים מודל כזה במערכת אוטומטית.

שאלות
נפוצות

איזה קובץ בדיוק כדאי להוריד מהרשימה?

אם יש לכם כרטיס מסך עם 24 גיגה בייט זיכרון, קחו את Q4_K_M או Q4_K_S. אם אתם מוגבלים במקום או זיכרון, אפשר לרדת לכיולי I כמו IQ3_M שמציגים ביצועים סבירים לנפח שלהם.

האם המודל יסרב לענות על שאלות מסוימות?

המודל מוגדר כמי שעבר הסרת סינונים, ולכן הוא לא אמור לסרב לבקשות. עם זאת, הוא עדיין מושפע מאימון הבסיס ויכול לפעמים לחרוג מההוראות בהתאם לניסוח הפרומפט.

איך מריצים

כדי להריץ אותו ישירות במחשב, LM Studio היא האפשרות המובנית שהיוצר מציין, או קריאה דרך שורת הפקודה עם llama.cpp. גרסת ברירת המחדל המומלצת לרוב השימושים היא Q4_K_M במשקל 19.85 גיגה בייט, והיא דורשת כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כדי לרוץ כולה על החומרה המהירה. מי שמחזיק פחות זיכרון יכול לבחור בכיולי ה־IQ הקטנים כמו IQ2_M או IQ3_XS, אך הם פוגעים באיכות התוכן.

אם אין לכם כרטיס חזק או זיכרון מערכת משמעותי, עבודה מקומית עם מודל 32 מיליארד פרמטרים על מעבד תהיה אטית להחריד. במקרה כזה, עדיף להשתמש בפתרון ענן מרוחק במקום להשקיע בחומרה מקומית יקרה.

ollama run hf.co/bartowski/DeepSeek-R1-Distill-Qwen-32B-abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

30 קבצים במאגר, 483 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. מצב כזה מייצר עמימות משפטית מלאה, ואי אפשר לדעת אם מותר להשתמש בקבצים האלה לצרכים מסחריים או להפיץ אותם במוצר ללקוחות. ארגונים מסודרים לא יכולים לקחת סיכון כזה בסביבת ייצור.

הרישיון המלא בעמוד המודל ↗