GPT
L

llama2_7b_chat_uncensored

קוד פתוח

georgesungother2023-07-20

  • transformers
  • pytorch
  • tensorboard
  • safetensors
  • llama

גרסה מכווננת של לאמה 2 בגודל שבעה מיליארד פרמטרים שעברה הסרה של חסימות תוכן. היא עונה על שאלות שהמודל המקורי של מטא מסרב לגעת בהן.

  • 6.7Bפרמטרים
  • 2,048טוקנים בהקשר
  • 50.2 GBמשקל הקבצים
  • 510הורדות בחודש

מה זה

הבסיס כאן הוא מודל שבעה מיליארד פרמטרים של מטא שעבר אימון נוסף בשיטת קיו-לורה על מאגר שיחות מסונן של ויזארד-ויקונה, שממנו הוסרו מנגנוני הסירוב הרגילים. המטרה היתה ליצור מודל שיחה שלא מטיף מוסר ולא חוסם בקשות רק בגלל מילות מפתח רגישות. האימון נמשך תקופה של איפוק אחד בלבד על כרטיס בודד של עשרים וארבעה גיגה-בייט.

במבחני הביצועים הוא מקבל ציון ממוצע של 43.39, וזה מספר שמספר סיפור די ברור. במבחני הבנת שפה כלליים כמו הלא-סוואג עם 78.66 ווינוגרנדה עם 74.11 הוא מחזיק מעמד יפה, אבל במשימות של חשיבה כמותית ומתמטיקה הוא קורס לגמרי עם 5.84 ב־GSM8K ו־5.69 ב־DROP. במילים אחרות, הוא יודע לנהל שיחה חופשית וזורמת, אך לא מסוגל לפתור בעיות מורכבות או לחשב דברים.

מתאים ל

  • בדיקות חסינות ואבטחה

    זיהוי נקודות תורפה ויצירת תרחישי קיצון ללא התנגדות מובנית של המודל לבקשות שנויות במחלוקת.

  • משחקי תפקידים וכתיבה

    יצירת דיאלוגים וסיפורים שלא נעצרים בגלל נושאים אפלים או שפה שאינה תאגידית ומצונזרת.

  • מחקר על התנהגות מודלים

    השוואת תשובות מול המודל המקורי כדי לבדוק איך הסרת שכבת הבטיחות משפיעה על איכות התוכן.

איפה זה נופל

החולשה העיקרית היא היעדר מוחלט של מנגנוני סינון ובקרה, מה שאומר שהוא יפלוט טעויות, הטעיות או תוכן בעייתי בלי לחשוב פעמיים. בנוסף, חלון ההקשר שלו מוגבל לאלפיים ארבעים ושמונה טוקנים בלבד, כך שאי אפשר להזין לו מסמכים ארוכים או לנהל איתו שיחות שנמשכות יותר מכמה שאלות. התוצאות הנמוכות שלו במבחני דיוק ואמת מראות שהוא נוטה להמציא עובדות בביטחון מלא, ולכן אסור להסתמך עליו כמקור מידע אמין.

שאלות
נפוצות

למה המודל הזה שוקל מעל חמישים גיגה-בייט למרות שיש לו רק שבעה מיליארד פרמטרים?

הקבצים שמורים בדיוק של פלוט 32 במקום הדיוק המקובל של פלוט 16 או פורמטים מכווצים. זה מנפח את נפח האחסון בלי לתת יתרון אמיתי באיכות. להרצה יומיומית מומלץ לחפש את הגרסאות המכווצות שלו.

האם הוא מתאים לפתרון בעיות היגיון או שאלות מתמטיות?

ממש לא. המבחנים שלו במתמטיקה מראים ציונים חד ספרתיים נמוכים במיוחד של פחות משישה אחוזים. הוא מיועד לשיחה חופשית וכתיבה, ולא לשום משימה שדורשת דיוק מספרי או חשיבה לוגית מסודרת.

איך מריצים

המשקל המלא של הקבצים כאן מגיע ליותר מחמישים גיגה-בייט כי הם נשמרו בדיוק רחב, מה שאומר שהורדה והרצה של המאגר הזה כמו שהוא תדרוש כרטיס מסך חזק מאוד וסבלנות בהורדה. המפתח עצמו אימן אותו על כרטיס A10G של 24GB. כדי לקבל תוצאות טובות חובה להקפיד על מבנה הפרומפט המדויק שבו הוא אומן, עם תגיות מוגדרות למשתמש ולתשובה.

בפועל, רוב האנשים לא צריכים להוריד את הגרסה הזו. קיימות גרסאות מכווצות בפורמטים של GGML ו־GPTQ, ויש גם תמיכה ישירה להרצה קלה דרך אולאמה. אם אתם רק רוצים לבדוק איך הוא מגיב בלי להסתבך עם ספריות של פייתון והגדרות חומרה, הגרסאות המכווצות יעבדו על מחשב אישי רגיל בלי שום בעיה.

from transformers import pipeline

pipe = pipeline("text-generation", model="georgesung/llama2_7b_chat_uncensored")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת הגדרה כללית של אחר, בין היתר בגלל השילוב בין תנאי השימוש המקוריים של לאמה 2 לבין מאגר הנתונים של ויקונה. המשמעות היא שאין כאן היתר מסחרי חופשי ופשוט, ומי שרוצה לשלב אותו במוצר מסחרי צריך לבדוק היטב את תנאי הבסיס של מטא לפני שהוא מוציא אותו החוצה.

הרישיון המלא בעמוד המודל ↗