GPT
L

mradermacher/Llama-3.2-3B-Instruct-uncensored-GGUF

קוד פתוח

mradermacherרישיון לא דווח2024-09-27

  • transformers
  • gguf
  • en
  • endpoints_compatible
  • conversational

גרסה מכווצת של Llama 3.2 בגודל 3B שהוסרו ממנה מנגנוני הסינון המקוריים. היא מיועדת למי שצריך מודל קומפקטי שמסוגל לענות על כל הוראה בלי לסרב או להטיף מוסר.

  • 35.2 GBמשקל הקבצים
  • 4,441הורדות בחודש
  • 62לייקים

מה זה

מדובר בהמרה של המודל chuanli11/Llama-3.2-3B-Instruct-uncensored לפורמט GGUF, שמבצע mradermacher באמצעות קוונטיזציה סטטית. המודל הבסיסי אומן לביצוע הוראות, אך שכבת הסירובים הוסרה ממנו, כך שהוא לא חוסם שאלות רגישות. בגודל של שלושה מיליארד פרמטרים הוא מהיר מאוד ומיועד בעיקר למי שמחפש ריצה עצמאית בלי תלות ברשת.

הדף מציג מגוון רחב של קבצים בשיטות דחיסה שונות, החל מגרסאות מצומצמות מאוד של 1.6 ג'יגה בייט ועד לקובץ f16 מלא ששוקל 7.3 ג'יגה בייט. לפי הערות המפרסם, גרסאות Q4_K_M ו־Q4_K_S נחשבות למומלצות ביותר ומציגות שילוב טוב של מהירות ועבודה חלקה, בעוד שדחיסות נמוכות כמו Q3_K_M סובלות מירידה מורגשת באיכות.

מתאים ל

  • עבודה אופליין במחשב מקומי

    צורך מעט מאוד זיכרון עבודה ומאפשר לקבל מענה מהיר להוראות ישירות גם על חומרה בסיסית וללא חיבור לרשת.

  • מחקר על מודלים ללא סינון

    בדיקת התנהגות מודלי שפה כאשר מנגנוני הסירוב וההטפה מנוטרלים לחלוטין מתוך המשקולות.

  • עיבוד טקסט חופשי

    ניתוח וסיווג של טקסטים גולמיים ורגישים שמודלים רגילים מסרבים לגעת בהם בגלל פילטרים אוטומטיים.

איפה זה נופל

גודל של שלושה מיליארד פרמטרים מציב רף יכולת נמוך יחסית, במיוחד בניתוח לוגי מורכב, כתיבת קוד ארוך או שמירה על עובדות מדויקות לאורך זמן. הוא נוטה להזיות כשהוא נשאל על דברים שאינו מכיר היטב.

מעבר לכך, הסרת מגבלות הבטיחות אומרת שהוא לא מסנן תשובות כלל. אם מחברים אותו למערכת חיצונית ללא מעטפת בדיקות משלכם, הוא עלול לייצר תוכן פוגעני, רעיל או מטעה בלי שום בלם מובנה.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מהרשימה?

עבור רוב השימושים כדאי לקחת את Q4_K_M או Q4_K_S ששוקלים קצת יותר מ־2.2 ג'יגה בייט. הם מציעים ביצועים מהירים מאוד כמעט בלי פגיעה מורגשת באיכות הפלט. אם המחשב מאפשר זאת ויש עוד קצת מקום בזיכרון, Q8_0 ייתן איכות מעט עדיפה.

האם המודל תומך בעבודה בעברית?

המודל מוגדר ומאומן בעיקר על אנגלית. הוא עשוי להבין מילים בעברית בסיסית, אך איכות התחביר והתשובות תהיה נמוכה משמעותית בהשוואה לאנגלית ולא מומלץ להסתמך עליו כמנוע שפה מקומי.

איך מריצים

המודל מגיע כקובץ GGUF יחיד לפי רמת הדחיסה שבחרתם, ומריצים אותו בכלים שתומכים בפורמט כמו llama.cpp. אפילו מחשב נייד פשוט עם 8 ג'יגה זיכרון יכול להריץ את הגרסאות המומלצות, שדורשות בסביבות 2.3 ג'יגה בייט של מקום בזיכרון. אין חובה בכרטיס מסך ייעודי כדי לקבל קצב תגובה טוב.

אם אתם מחפשים קובץ קל, לכו על Q4_K_M או Q4_K_S. אם חשוב לכם לחלץ את מלוא היכולת של המודל בלי לאבד דיוק, גרסת Q8_0 שוקלת 3.9 ג'יגה בייט ונותנת את התוצאה הקרובה ביותר למקור. שווה לעבור ל־API חיצוני רק אם אתם צריכים לוגיקה עמוקה או משימות קוד מורכבות שהגודל הזה פשוט קטן עליהן.

ollama run hf.co/mradermacher/Llama-3.2-3B-Instruct-uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון לא דווח בעמוד המודל. מצב כזה משאיר חוסר ודאות משפטית לגבי שימוש מסחרי, הפצה בתוך מוצר או שילובו בקוד סגור. לפני שמשלבים אותו בפרויקט עסקי, מומלץ לבדוק את תנאי המודל המקורי של chuanli11 ושל מטא.

הרישיון המלא בעמוד המודל ↗