GPT
H

huihui-ai_DeepSeek-R1-Distill-Llama-70B-abliterated-GGUF

קוד פתוח

bartowskiרישיון לא דווח2025-02-01

  • gguf
  • abliterated
  • uncensored
  • text-generation
  • endpoints_compatible

גרסה מכווצת של מודל ההסקה 70B שעברה הסרת מגבלות בטיחות. היא נותנת תשובות ישירות בלי שרשראות סירוב, בהרצה עצמית דרך llama.cpp.

  • 776 GBמשקל הקבצים
  • 9,634הורדות בחודש
  • 43לייקים

מה זה

המודל הזה הוא המרה של DeepSeek-R1-Distill-Llama-70B שעבר abliteration על ידי huihui-ai, ונארז כאן בפורמט GGUF על ידי bartowski בעזרת גרסה b4585 של llama.cpp. כל הגרסאות נוצרו בשיטת imatrix עם דאטה-סט כיול ייעודי, מה שעוזר לשמור על יכולות ההסקה והלוגיקה של מודל המקור גם כשמכווצים אותו לגדלים נמוכים.

בניגוד לגרסת הבסיס של מטא או הזיכוך הרגיל של DeepSeek, המודל הזה עבר שינוי במשקולות שנועד לנטרל את מנגנוני הסירוב המובנים שלו. התוצאה היא מודל חשיבה חזק של 70 מיליארד פרמטרים שממלא הוראות בלי להרצות על מה מותר ומה אסור, בתנאי שמשתמשים בתבנית הפרומפט הספציפית שכוללת תגיות מערכת, משתמש ועוזר.

מתאים ל

  • מחקר ובדיקות חדירות

    המודל עונה בלי סירובים מובנים, מה שמתאים לבדיקות אבטחה וסימולציות התקפה.

  • הרצה מקומית ב־LM Studio

    קבצי ה־GGUF נתמכים ישירות בתוכנה ומאפשרים עבודה אופליין ללא תלות ברשת.

  • ניתוח לוגיקה על חומרה מקומית

    שומר על מנגנון החשיבה של DeepSeek-R1 בגודל שנכנס לשרת פנימי של 48GB VRAM.

איפה זה נופל

בגלל הסרת המגבלות, המודל לא עוצר את עצמו מפני פליטת מידע מסוכן או שגוי, ואין כאן מעקה בטיחות שיגן על המשתמשים שלכם. מעבר לזה, רמות הכיווץ הנמוכות מתחת ל־Q3 מאבדות דיוק בצורה מורגשת ביכולות ההסקה המורכבות. גרסאות I-quant עובדות לאט יותר על מעבדים או מחשבי אפל, והן לא נתמכות בכלל בתשתיות שמריצות Vulkan.

שאלות
נפוצות

איזה קובץ כדאי להוריד למחשב שלי?

אם יש לכם כרטיס מסך שמחזיק מעל 44 גיגה VRAM, קחו את Q4_K_M. אם אתם קצרים בזיכרון, נסו את IQ4_XS או Q3_K_XL, אבל אל תתקרבו ל־IQ1_M כי האיכות שלו נמוכה מדי.

למה צריך את תבנית הפרומפט המיוחדת?

המודל אומן סביב תגיות ספציפיות להפרדה בין שאלת המשתמש, הגדרות המערכת והחשיבה של העוזר. אם לא תשתמשו בתבנית המדויקת שמופיעה בכרטיס, תקבלו תשובות מקוטעות או חוסר תגובה.

האם המודל מתאים למוצר שפונה ללקוחות?

לא הייתי שם אותו מול משתמשי קצה בלי שכבת סינון עצמאית. ביטול מנגנוני הסירוב אומר שהוא יכול לפלוט תוכן פוגעני או רעיל בלי שום סינון מקדים.

איך מריצים

כדי להריץ אותו כמו שצריך תצטרכו זיכרון רציני. המשקלים נעים בין 16.75 גיגה-בייט לגרסת IQ1_M המנוונת ועד 74.98 גיגה-בייט לגרסת Q8_0, שדורשת הורדה של מספר קבצים מפוצלים. ברירת המחדל המומלצת לעבודה שוטפת היא Q4_K_M במשקל 42.52 גיגה-בייט, או IQ4_XS ששוקלת 37.90 גיגה-בייט. לביצועים סבירים צריך כרטיס עם לפחות 48 גיגה VRAM, או שני כרטיסי 24 גיגה, אחרת תשלמו בירידה חדה בקצב הטוקנים במעבר לזיכרון הראשי.

אפשר לטעון את הקבצים ישירות בתוך LM Studio או דרך llama.cpp. אם אתם עובדים על מעבדי ARM או מעבדי אינטל ו־AMD עם AVX, קבצי Q4_0 ו־IQ4_NL כוללים תמיכה בסידור מחדש של המשקולות בזמן ריצה כדי לחסוך זמן עיבוד.

ollama run hf.co/bartowski/huihui-ai_DeepSeek-R1-Distill-Llama-70B-abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 776 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המודל לא דווח בדף המקור. במצב כזה, מבחינה משפטית אין היתר שימוש מוגדר, ואי אפשר לדעת אם מותר לשלב אותו במוצר מסחרי בלי להסתכן בהפרת זכויות של מטא או DeepSeek.

הרישיון המלא בעמוד המודל ↗