GPT
P

pygmalion-13b-4bit-128g

קוד פתוח

notstoicother2023-05-18

  • transformers
  • pytorch
  • llama
  • text-generation
  • en

גרסה מכווצת בארבעה ביט של מודל המיועד לשיחות ולמשחקי תפקידים. הוא נבנה כדי לפעול על כרטיסי מסך ביתיים בלי לדרוש משאבי ענן כבדים.

  • 2,048טוקנים בהקשר
  • 6.9 GBמשקל הקבצים
  • 135הורדות בחודש
  • 151לייקים

מה זה

מדובר בהמרה של pygmalion-13b לפורמט safetensors בעזרת כימום GPTQ עם קבוצות של 128. המטרה של המהלך הזה היא לדחוס מודל של שלושה עשר מיליארד פרמטרים לנפח של פחות משבעה גיגה בייט, כך שיוכל להיכנס לזיכרון של כרטיס גרפי צרכני רגיל.

בבסיסו הוא נשען על ארכיטקטורת Llama ומיועד למשימות יצירת טקסט באנגלית, בעיקר סביב צ'אט אינטראקטיבי ודמויות. יוצר המודל מזהיר מראש שהוא כולל תכנים למבוגרים בלבד, כך שאין כאן מנגנוני סינון מחמירים שמקובל למצוא במודלים מסחריים רגילים.

חלון ההקשר עומד על 2,048 טוקנים בלבד, מה שמגביל את אורך השיחה הרציפה. הוא מתאים למי שרוצה להריץ שיחות ומשחקי תפקידים מקומית בלי לשתף מידע עם שרת חיצוני, אך מוגבל מאוד בהשוואה למודלים מודרניים יותר.

מתאים ל

  • משחקי תפקידים מקומיים

    הוא מותאם ספציפית לדיאלוגים אינטראקטיביים חופשיים ונכנס במלואו לכרטיס מסך ביתי רגיל.

  • בדיקת תוכני שיחה לא מצונזרים

    מתאים למי שחוקר תגובות מודלים ללא מגבלות בטיחות או צנזורה מסחרית מובנית.

  • הרצה מקומית במחשב אישי

    שוקל פחות משבעה גיגה בייט ומאפשר שימוש עצמאי ללא תלות ברשת או תשלום לפי טוקן.

איפה זה נופל

המודל פולט תכנים מפורשים ואינו מיועד בשום אופן לקטינים, כך שאי אפשר להטמיע אותו במוצר שמיועד לקהל הרחב בלי שכבת סינון קשיחה משלכם. בנוסף, חלון ההקשר קצר מאוד ומחזיק רק 2,048 טוקנים, מה שגורם לו לשכוח עובדות מוקדמות בשיחות ממושכות. הוא אומן באנגלית בלבד ולכן לא יתפקד היטב בעברית.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לשיחות בעברית?

המודל הוגדר ואומן עבור השפה האנגלית בלבד. הוא לא מיועד להבין עברית או לייצר פלטים תקינים בה, ולכן עדיף לא לבנות עליו למשימות בשפה זו.

איזה כרטיס מסך צריך כדי להפעיל אותו מקומית?

המשקל שלו הוא 6.9 גיגה בייט בזכות הכימום לארבעה ביט. כרטיס מסך בעל עשרה עד שנים עשר גיגה בייט של זיכרון יספיק כדי לטעון אותו ולנהל שיחה קצרה.

איך מריצים

בזכות הכימום לארבעה ביט, המשקל הכולל יורד ל־6.9 גיגה בייט. זה אומר שכרטיס מסך בודד עם עשרה או שנים עשר גיגה זיכרון וידאו יחזיק אותו בקלות יחד עם ההקשר המלא, בלי שתצטרכו לשלם על שרתי ענן ייעודיים.

ההרצה מתבצעת בעזרת transformers ותמיכה ב־GPTQ. אם המטרה היא סתם לבדוק יצירת טקסט כללית ולא שיחות תפקידים ללא צנזורה, עדיף להשתמש ב־API זמין ומוכן שחוסך את ההתעסקות בהגדרות החומרה.

from transformers import pipeline

pipe = pipeline("text-generation", model="notstoic/pygmalion-13b-4bit-128g")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולכן תנאי השימוש המדויקים אינם מפורטים בעמוד. במצב כזה אי אפשר להניח שמותר להשתמש בו לצרכים מסחריים, ומי שרוצה לשלב אותו במוצר פומבי לוקח על עצמו סיכון משפטי לא ברור.

הרישיון המלא בעמוד המודל ↗