GPT
W

WizardLM-1.0-Uncensored-Llama2-13B-GGUF

קוד פתוח

TheBlokellama22023-09-05

  • transformers
  • gguf
  • llama
  • en

גרסת GGUF שעברה כימות למודל של אריק הרטפורד, המבוסס על Llama 2 בגודל 13 מיליארד פרמטרים. המטרה שלו היא לציית להוראות ישירות בלי מנגנוני סירוב מובנים שחוסמים בקשות רגישות.

  • 91.9 GBמשקל הקבצים
  • 8,096הורדות בחודש
  • 75לייקים

מה זה

מדובר בהסבה של WizardLM 1.0 על גבי Llama 2, שאומן מחדש על דאטה-סט מסונן כדי להפחית סירובים והתחמקות מתשובות. המפרסם TheBloke ארז אותו בפורמט GGUF, כך שאפשר להריץ אותו מקומית על מעבד רגיל או כרטיס מסך ביתי באמצעות ספריות כמו llama.cpp.

בניגוד למודלים סטנדרטיים שמגיעים עם מעטפת בטיחות אגרסיבית ומסרבים לבצע משימות רבות, המודל הזה אמור לבצע בדיוק את מה שמבקשים ממנו. עם זאת, יוצר המודל מבהיר שמודל הבסיס עצמו מחזיק בהטיות מובנות, כך שאין באמת ביטול מוחלט של כל גבול, אלא רק ציות גבוה משמעותית ביחס לגרסה הרגילה.

מתאים ל

  • מחקר אבטחת מידע

    הפקת דוגמאות ובדיקות עמידות ללא סירובים מובנים של מנגנוני בטיחות.

  • כתיבה יצירתית חופשית

    יצירת תכנים בדיוניים מורכבים בלי שהמערכת תקטע את התשובה באמצע.

  • ריצה מקומית על מחשב נייד

    גרסת Q4_K_M מאפשרת הרצה על חומרה ביתית סבירה ללא תלות ברשת.

איפה זה נופל

המודל מוגדר כנטול מעצורים, מה שאומר שהוא מסוגל לפלוט תוכן מזיק, פוגעני או שגוי לחלוטין בלי להתריע. האחריות על כל פלט נופלת ישירות עליכם. בנוסף, הוא אומן על אנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד שפה טבעית בעברית. לפני שמחברים אותו למערכת חיצונית, חובה לבדוק איזה פלטים הוא מייצר ולא להשאיר אותו ללא פיקוח מול משתמשי קצה.

אותה משפחה

WizardLM-1.0-Uncensored-Llama2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל הקבצים שמופיעים בדף?

ממש לא. מורידים רק קובץ כימות יחיד שמתאים למגבלות הזיכרון של המחשב שלכם, כמו קובץ ה־Q4_K_M. הורדת כל 91.9 הג'יגה-בייט פשוט תבזבז לכם מקום בדיסק.

באיזה מבנה פנייה צריך להשתמש כדי לקבל תוצאות טובות?

המודל אומן לפי הפורמט של Vicuna 1.1. יש להגדיר שורת מערכת ולאחריה פניות במבנה המדויק של USER ולאחר מכן ASSISTANT.

איך מריצים

טוענים קובץ בודד לתוך כלי תומך כמו LM Studio, llama.cpp או שרת פייתון עם ctransformers. אין צורך להוריד את כל 18 הקבצים מהמאגר, אלא רק את הכימות שמתאים לחומרה שלכם. גרסאות נמוכות כמו Q2_K שוקלות 5.43 ג'יגה-בייט ודורשות כמעט 8 ג'יגה-בייט זיכרון אך סובלות מאובדן איכות כבד, בעוד שגרסת Q4_K_M שוקלת 7.87 ג'יגה-בייט, דורשת 10.37 ג'יגה-בייט זיכרון ומספקת איזון טוב.

גרסאות כבדות כמו Q8_0 מגיעות ל־13.83 ג'יגה-בייט ומצריכות מעל 16 ג'יגה-בייט זיכרון עבודה. אם אין לכם כרטיס מסך עם מספיק זיכרון כדי לפרוק אליו שכבות חישוב, הריצה על מעבד בלבד תהיה אטית, ובמצב כזה עדיף לשלם לפי שימוש לספק שמחזיק מודל כזה מאחורי API.

ollama run hf.co/TheBloke/WizardLM-1.0-Uncensored-Llama2-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון llama2 של מטא. הרישיון מתיר שימוש מסחרי ומחקר, אך כפוף למדיניות השימוש של מטא ולהגבלות על מוצרים בעלי מאות מיליוני משתמשים פעילים. יש לוודא שהשימוש המסחרי שאתם מתכננים עומד בתנאי הרישיון המקוריים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗