GPT
L

llama2_70b_chat_uncensored-GGUF

קוד פתוח

TheBlokellama22023-09-06

  • transformers
  • gguf
  • llama
  • uncensored
  • wizard

גרסה מכווצת של מודל ענק לשיחה, שאומן מחדש בלי מנגנוני הבטיחות הרגילים. הוא עונה על שאלות בלי להטיף מוסר ובלי לסרב לבקשות בוטות.

  • 486 GBמשקל הקבצים
  • 5,850הורדות בחודש
  • 47לייקים

מה זה

ג'ראד הופ לקח את מודל הבסיס של מטא והעביר אותו אימון עם QLoRA במשך שלושה מחזורים על כרטיס A100 יחיד של 80GB, תהליך שלקח בערך שבוע. הוא השתמש במאגר השיחות wizard_vicuna_70k_unfiltered כדי לנקות את התשובות המתחסדות והסירובים המובנים שמאפיינים את מודל השיחה הרשמי. התוצאה עונה ישירות ובלי ניסיון לחנך את המשתמש, אפילו בשאלות בסיסיות או גסות.

דה בלוק לקח את המשקלים המקוריים והמיר אותם לפורמט GGUF במספר רמות כימות. אין פה מבחני ביצועים מספריים או ציונים רשמיים, אלא דוגמה מעשית אחת שמראה את ההבדל: במקום להסביר למה המילה קקי אינה מדעית ולהציע מונחים חלופיים, המודל פשוט מגדיר את המילה בצורה יבשה וישירה.

מתאים ל

  • עוזר שיחה ללא צנזורה

    מענה ישיר ומדויק לשאלות שיוצרות סירובים שווא במודלים רגילים.

  • מחקר על התנהגות מודלים

    בדיקת ההטיות הטבעיות של המודל ללא שכבות הסינון של חברות הענק.

  • יצירת תוכן חופשי

    כתיבת דיאלוגים וסיפורים ללא חשש מחסימת מילים או הטפת מוסר.

איפה זה נופל

ההסרה של מנגנוני הבטיחות אומרת שהוא ייצר תוכן פוגעני, שגוי או רעיל בלי שום מעצור פנימי. מעבר לזה, יוצר המודל מציין במפורש שההטיות המובנות של מודל הבסיס עדיין קיימות בו. אין לו שכבת הגנה שמסננת מידע מסוכן, כך שכל האחריות על בקרת הפלט נופלת עליכם. חלון ההקשר שלו מוגדר ל־4096 טוקנים בלבד, מה שמגביל עבודה עם טקסטים ארוכים במיוחד.

אותה משפחה

llama2-70b-chat-uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מחברים את הקבצים המפוצלים של הגרסאות הגדולות?

במערכות לינוקס ומק משתמשים בפקודת cat כדי לאחד את שני חלקי ה־split לקובץ GGUF אחד ואז מוחקים את המקור. בווינדוס מריצים פקודת COPY עם הדגל /B בשורת הפקודה כדי לחבר את החלקים.

באיזה פורמט פניות צריך להשתמש כדי לקבל תוצאות טובות?

האימון נעשה במבנה קבוע של HUMAN ולאחריו השאלה, ואז שורה עם RESPONSE שבה המודל מייצר את התשובה. חריגה מהתבנית הזו עלולה לפגוע באיכות המענה.

איך מריצים

כדי להריץ אותו צריך זיכרון עבודה רציני או כרטיסי מסך חזקים מאוד. הגרסה המומלצת לרוב האנשים היא Q4_K_M, ששוקלת 41.42 GB ודורשת 43.92 GB של זיכרון אם מריצים רק על המעבד, או שטח תואם בזיכרון כרטיס המסך כדי לפרוק אליו שכבות. הקבצים הגדולים יותר, כמו Q6_K או Q8_0 שדורש 75.79 GB זיכרון, פוצלו לשני חלקים בגלל מגבלות האתר וחובה לאחד אותם ידנית אחרי ההורדה.

מריצים אותו דרך כלים כמו llama.cpp, text-generation-webui או ספריות פייתון כמו ctransformers עם תבנית הפנייה HUMAN ו־RESPONSE. אם אין לכם חומרה ייעודית עם עשרות גיגה בייטים פנויים, הריצה המקומית תהיה איטית ביותר או שלא תעלה בכלל.

ollama run hf.co/TheBloke/llama2_70b_chat_uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל כפוף לרישיון של llama2. הרישיון הזה מתיר שימוש מסחרי ומחקרי, אבל כולל הגבלות ספציפיות של מטא לגבי שימושים אסורים ומחייב הסכמה לתנאי השימוש המקוריים שלהם אם אתם משלבים אותו במוצר.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗