GPT
W

Wizard-Vicuna-7B-Uncensored-GGUF

קוד פתוח

TheBlokeother2023-09-19

  • transformers
  • gguf
  • llama
  • uncensored
  • en

גרסת קוונטיזציה של מודל שבעה מיליארד פרמטרים שאומן ללא מנגנוני סינון והטפה. המטרה כאן היא לקבל תשובות ישירות בלי סירובים מובנים.

  • 47.7 GBמשקל הקבצים
  • 4,514הורדות בחודש
  • 52לייקים

מה זה

המודל מבוסס על LLaMA-7B ועבר אימון על בסיס נתונים של Wizard Vicuna שממנו נוקו מראש תשובות שכללו הטפה מוסרית או התאמות יישור. יוצר המקור אריק הרטפורד בנה אותו כבסיס גולמי שעליו אפשר להלביש התאמות נפרדות, ללא מגבלות מובנות מראש מצד המפתח. החבילה הנוכחית כוללת המרות GGUF שמיועדות להרצה יעילה בתוכנות מקומיות.

הוא מיועד למי שמחפש מודל קומפקטי שמבצע הוראות בצורה מדויקת לפי תבנית השיחה של Vicuna, מבלי להיתקל בסירובים על שאלות שנויות במחלוקת. אין בכרטיס המודל ציוני מבחנים או מדדי ביצועים מספריים, כך שההבדל העיקרי מול חלופות באותו סדר גודל טמון בהסרת מעצורי התוכן ובהתאמה שלו לעבודה ישירה על חומרה ביתית.

מתאים ל

  • מחקר על מודלים ללא סינון

    בדיקת התנהגות מודלי שפה ללא מעצורי בטיחות וחקירת שיטות יישור חיצוניות כמו LoRA.

  • עוזר מקומי בחומרה צנועה

    קובץ Q4_K_M דורש 6.58 גיגה זיכרון ועובד ישירות על מעבד ביתי דרך llama.cpp.

  • יצירת טקסט ללא סירובים

    כתיבה יצירתית ומשחקי תפקידים שנתקלים בסירובים מיותרים במודלים שעברו יישור יתר.

איפה זה נופל

היוצר מציין במפורש שלמודל אין מעקות בטיחות. הוא לא מסרב לבקשות, ולכן פלט רעיל, פוגעני או מסוכן נופל באחריות המשתמש בלבד, בדיוק כמו שימוש בסכין או רכב. בנוסף, מדובר במודל ישן משנת 2023 עם חלון הקשר מוגדר של 2048 טוקנים ואימון באנגלית בלבד. לא הייתי בונה עליו לניתוח טקסטים ארוכים, ובעברית הוא כנראה יישבר מהר.

אותה משפחה

Wizard-Vicuna-7B-Uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם כדאי להוריד את כל הקבצים במאגר?

לא, המאגר מכיל 15 קבצים בנפח כולל של 47.7 גיגה בייט שמייצגים רמות שונות של דחיסה. צריך לבחור רק קובץ אחד, למשל Q4_K_M או Q5_K_M, לפי כמות הזיכרון שיש לכם במחשב.

האם אפשר להשתמש במודל בעברית?

השפה שמוגדרת במאגר היא אנגלית בלבד. המודל מבוסס על LLaMA מהדור הראשון, ולכן היכולת שלו להבין ולייצר עברית תקינה תהיה חלשה מאוד בהשוואה למודלים מודרניים.

איך מריצים

להרצה מקומית מורידים קובץ בודד בהתאם לזיכרון הפנוי. הגרסאות נעות בין Q2_K הזעירה ששוקלת 2.83 גיגה בייט ודורשת 5.33 גיגה בייט זיכרון אך מגיעה עם אובדן איכות משמעותי, ועד Q8_0 שדורשת 9.66 גיגה בייט זיכרון. הגרסה המאוזנת והמומלצת בכרטיס היא Q4_K_M, שדורשת 6.58 גיגה בייט זיכרון ללא פריקה לכרטיס מסך.

אפשר להריץ אותו דרך llama.cpp, ממשקים כמו LM Studio וטקסט גנריישן ווב יו איי, או דרך פייתון עם ספריות ctransformers וליאמה סי פי פי פייתון. פריקת שכבות לכרטיס מסך מורידה את צריכת הזיכרון הראשי. אם יש לכם מחשב ללא מאיץ גרפי ואין לכם עניין בניהול משאבים מקומי, עדיף להשתמש בממשק מרוחק.

ollama run hf.co/TheBloke/Wizard-Vicuna-7B-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשמי מוגדר other ולא מפורט בטקסט. המודל מתבסס על LLaMA הראשון ועל נתוני Wizard, כך שאין היתר ברור לשימוש מסחרי חופשי. מי שמתכנן להפיץ אותו בתוך מוצר מסחרי לוקח סיכון משפטי וצריך לבדוק את תנאי הבסיס של המודלים המקוריים.

הרישיון המלא בעמוד המודל ↗