GPT
D

DeepSeek-R1-Distill-Llama-8B-Abliterated-GGUF

קוד פתוח

mradermacherרישיון לא דווח2025-01-21

  • transformers
  • gguf
  • en
  • endpoints_compatible
  • conversational

גרסת GGUF שעברה הסרת מגבלות סירוב, מבוססת על מודל חשיבה מזוקק של DeepSeek וארכיטקטורת Llama. היא מתאימה למי שרוצה להריץ מודל חשיבה מקומי בלי חסימות בטיחות מובנות.

  • 134 GBמשקל הקבצים
  • 8,046הורדות בחודש
  • 41לייקים

מה זה

מדובר בהמרה של המודל DeepSeek-R1-Distill-Llama-8B שעבר תהליך אבלציה, כלומר ניטרול של מנגנוני הסירוב והצנזורה שהוטמעו בו באימון המקורי. המודל שומר על יכולות הניתוח והחשיבה של סדרת R1 המזוקקת בתוך מעטפת קומפקטית של Llama, אבל לא יסרב לענות על שאלות שנויות במחלוקת או כאלה שמודלים סטנדרטיים חוסמים מיד.

היוצר ארז כאן שורה של קוונטיזציות סטטיות בפורמט GGUF, החל מגרסאות מכווצות מאוד ועד למשקל מלא. בכרטיס המודל מסומנות גרסאות Q4_K_S ו־Q4_K_M כנקודת האיזון המומלצת שנותנת מהירות טובה בלי לאבד הרבה מהדיוק. אם מחפשים שמירה מקסימלית על איכות החשיבה המקורית של 8 מיליארד הפרמטרים, גרסת Q8_0 מובילה, אבל דורשת כמעט כפול זיכרון.

מתאים ל

  • מחקר אבטחה ובדיקות חדירה

    המודל עונה בלי סירובים מובנים, ומאפשר סימולציות התקפה וכתיבת סקריפטים טכניים.

  • חשיבה מורכבת על חומרה צנועה

    מביא יכולות היסק של DeepSeek R1 למחשב מקומי עם כרטיס מסך של 12 גיגה בייט.

  • עיבוד טקסט ללא צנזורה

    מתאים לניתוח טקסטים גולמיים ומסמכים רגישים שהיו נחסמים על ידי שירותי ענן רגילים.

איפה זה נופל

הסרת מגבלות הבטיחות אומרת שהמודל הזה פולט תוכן ללא פילטרים, מה שהופך אותו ללא מתאים לחלוטין למוצרים שפונים לקהל הרחב בלי מעטפת סינון חיצונית. מעבר לכך, זה עדיין מודל 8B מזוקק, מה שאומר שהוא עלול להזות עובדות בהנמקות ארוכות, והכרטיס הרשמי מציין במפורש שגרסאות כמו Q3_K_M סובלות מאיכות נמוכה מורגשת ביחס לאחרות.

שאלות
נפוצות

למה הקבצים מופיעים בשני חלקים ואיך משתמשים בהם?

הקבצים חולקו לשניים כדי לעמוד במגבלות הגודל של האתר. מורידים את שני החלקים של אותה רמת קוונטיזציה, למשל Q4_K_M, ומאחדים אותם לקובץ GGUF אחד לפני הטעינה בעזרת פקודת איחוד פשוטה במערכת ההפעלה.

איזו גרסה כדאי להוריד לשימוש יומיומי?

גרסאות Q4_K_M או Q4_K_S הן הבחירה המומלצת לפי כרטיס המודל. הן שוקלות מתחת ל־10 גיגה בייט, רצות מהר ומספקות איכות היסק מספקת בלי לחנוק את החומרה.

איך מריצים

כדי להריץ אותו צריך תוכנה שתומכת בקבצי GGUF כמו llama.cpp. שימו לב שהקבצים במאגר הזה מחולקים לשני חלקים בגלל מגבלות גודל, ולכן תצטרכו לאחד אותם לפני הטעינה לפי ההוראות המקובלות לקבצים מפוצלים.

מבחינת חומרה, גרסאות ה־Q4 המומלצות שוקלות בין 9.5 ל־9.9 גיגה בייט, כך שכרטיס מסך עם 12 או 16 גיגה בייט של VRAM יחזיק את כל המודל בזיכרון בקלות. אם אתם מכוונים לגרסת ה־Q8_0 שדורשת מעל 17 גיגה בייט, תצטרכו חומרה חזקה יותר או חלוקת עבודה בין המעבד לכרטיס המסך.

ollama run hf.co/mradermacher/DeepSeek-R1-Distill-Llama-8B-Abliterated-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

26 קבצים במאגר, 134 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המפתח לא דיווח על רישיון בעמוד המודל. במצב כזה אין אישור שימוש ברור, מה שהופך כל שילוב שלו במוצר מסחרי או הפצה בארגון לסיכון משפטי, אלא אם מבררים את תנאי הבסיס של המודל המקורי ממנו הוא נגזר.

הרישיון המלא בעמוד המודל ↗