GPT
L

Llama-3.2-3B-Instruct-uncensored-GGUF

קוד פתוח

bartowskiרישיון לא דווח2024-10-26

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מכווצת למודל 3B שהוסרו ממנו מנגנוני הסינון המקוריים של מטא. הוא מתאים למי שחייב מודל קל משקל שיענה על כל שאלה בלי לחנך או לחסום.

  • 53.4 GBמשקל הקבצים
  • 52,170הורדות בחודש
  • 120לייקים

מה זה

מדובר בהמרה של המודל Llama-3.2-3B-Instruct-uncensored לפורמט GGUF בעזרת כלי llama.cpp, בשיטת imatrix. המקור הוא מודל שפה קטן יחסית שעבר הסרה של חסימות הבטיחות הסטנדרטיות, כך שהוא לא מסרב לבקשות שנויות במחלוקת כמו המודל הרשמי של מטא. bartowski ארז אותו בעשרות רמות קוונטיזציה שונות, מקבצי F16 מלאים ועד גרסאות דחוסות מאוד של 2 ביט.

בגודל של שלושה מיליארד פרמטרים, המודל מתמקד במענה מהיר על משימות טקסט כלליות. העבודה עם imatrix אמורה להפחית את אובדן הדיוק שנוצר בכיווץ, אבל הוא נשאר מודל קטן עם מגבלות היסק ברורות לעומת מודלים גדולים.

מתאים ל

  • מענה מקומי ללא סינון

    מייצר תשובות לנושאים רגישים שמודלים רגילים חוסמים, ישירות על מחשב אישי בלי תלות ברשת.

  • הרצה על חומרת קצה ו־ARM

    רץ מצוין על מעבדים פשוטים ורכיבי ARM בזכות קבצים קלים של כ־2 גיגה בייט וגרסאות ייעודיות.

  • בדיקות אוטומציה וסימולציה

    מתאים לבדיקת תרחישי קיצון בתוכנה שבהם נדרש מודל שלא עוצר או מחזיר שגיאות סירוב.

איפה זה נופל

ההסרה של מנגנוני הסינון חושפת אתכם לפליטת תוכן בעייתי, לא מדויק או פוגעני ללא התרעה. מעבר לזה, מודל של 3B סובל מהזיות תכופות במשימות מורכבות, מתקשה בלוגיקה עמוקה, ולא מכיר עובדות מעבר לחיתוך הידע שלו מדצמבר 2023. תצטרכו לבדוק היטב את הפלטים שלו לפני שאתם סומכים עליהם במערכת אוטומטית.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד למחשב רגיל?

הגרסה המאוזנת ביותר היא Q4_K_M ששוקלת 2.24 גיגה בייט. היא נותנת איכות טובה ביחס למשקל ורצה כמעט על כל חומרה מודרנית בלי מאמץ.

האם המודל מתאים לשימוש מסחרי במוצר?

לא מומלץ להסתמך עליו מסחרית כרגע, כי בעמוד לא צוין רישיון כלל. חוסר המידע חושף אתכם לסיכוני זכויות יוצרים.

למה כדאי להעדיף אותו על פני Llama 3.2 3B המקורי?

הסיבה היחידה לבחור בו היא היעדר הצנזורה. אם המודל הרשמי של מטא מסרב לענות על שאילתות מסוימות שדרושות לכם, הגרסה הזו תענה בלי לחסום.

איך מריצים

המשקלים נעים בין 1.49 גיגה בייט בגרסת Q2_K ועד 7.22 גיגה בייט בגרסת f16 המלאה. רוב האנשים יבחרו בגרסת Q4_K_M ששוקלת 2.24 גיגה בייט, או ב־Q5_K_M ששוקלת 2.59 גיגה בייט, שתיהן נכנסות בקלות לכל כרטיס מסך בסיסי עם 4 או 6 גיגה זיכרון, ורצות חלק גם על מעבד רגיל ב־LM Studio או ישירות ב־llama.cpp.

אם אתם על חומרת ARM יש שם גרסאות ייעודיות כמו Q4_0_4_4 שלא מיועדות למחשבי מק או ווינדוס. שווה להריץ אותו מקומית רק אם חייבים פרטיות מלאה או פעולה ללא סינון, אחרת מודלים גדולים יותר דרך API יתנו תוצאות מדויקות פי כמה.

ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר לדעת אילו הגבלות חלות על הפצה שלו בתוך מוצר. שילוב שלו במערכת עסקית יוצר סיכון משפטי עד לבירור הרישיון של מודל המקור.

הרישיון המלא בעמוד המודל ↗