GPT
V

vicuna-13b-GPTQ-4bit-128g

קוד פתוח

anon8231489123רישיון לא דווח2023-04-03

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

גרסה מכווצת של מודל שיחה שנועדה לעלות ישירות על כרטיס מסך ביתי. הוא מיועד למי שמחפש הרצה מקומית בלי לשלם על שרתים כבדים.

  • 2,048טוקנים בהקשר
  • 6.9 GBמשקל הקבצים
  • 183הורדות בחודש
  • 663לייקים

מה זה

מדובר בהמרה לכימות של ארבעה ביט למודל ויקוניה 13B המקורי, שנעשתה באמצעות GPTQ כדי לדחוס את המשקלים לגודל שמתאים לחומרה צנועה. במקור המודל מבוסס על הארכיטקטורה של לאמה, ואומן למשימות של יצירת טקסט ושיחה חופשית.

היוצר העלה את המשקלים כשהם כבר מוכנים לעבודה, אחרי הוספת טוקן יחיד לטוקנייזר שלו. זה לא אימון חדש אלא עבודת אופטימיזציה ישירה, שנועדה לאפשר לאנשים לבדוק את היכולות של ויקוניה בלי לחכות לזמני טעינה ארוכים ובלי להחזיק זיכרון וידאו עצום ששמור בדרך כלל לחוות שרתים.

מתאים ל

  • עוזר שיחה מקומי

    רץ ישירות על החומרה שלכם בלי לשלוח נתונים החוצה ומספק מענה קצר בטקסט.

  • ניסויי כימות בבית

    מאפשר לבדוק איך GPTQ מתנהג בפועל על כרטיס מסך רגיל בלי להשקיע במשאבים.

  • טיוח טקסטים מהיר

    מייצר פסקאות ורעיונות ראשוניים על המחשב ללא תלות ברשת או בחיבור חיצוני.

איפה זה נופל

חלון ההקשר קצר מאוד ומגיע לאלפיים ארבעים ושמונה טוקנים בלבד, כך שאי אפשר להזין לו מסמכים ארוכים או לנהל שיחות ממושכות. בנוסף, מדובר בהמרה מוקדמת של משתמש אנונימי שלא צירף בדיקות ביצועים מסודרות, והכרטיס מציין במפורש שהתוכן עובר צנזורה שמגבילה את התשובות.

שאלות
נפוצות

האם הוא יעבוד לי על כרטיס מסך ביתי?

כן, המשקל שלו תופס פחות משבעה גיגה בזיכרון, ולכן כרטיס מודרני ממוצע יכול להריץ אותו. צריך רק לוודא שיש תמיכה מתאימה בדרייברים של אנבידיה ובתוכנת ההרצה.

אפשר לחבר אותו למאגר מסמכים ארגוני?

לא מומלץ בכלל. חלון ההקשר שלו מוגבל לאלפיים טוקנים, מה שלא משאיר כמעט מקום לטקסט מהמסמך לצד השאלה והתשובה.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם תמיכה בקידוד CUDA וסביבה כמו אובבוגה, שבה מגדירים ארבעה ביט וגודל קבוצה של 128 לפי ההנחיות של הממיר. המשקל הכולל יושב על פחות משבעה גיגה, כך שכרטיס מסך ממוצע מחזיק אותו בלי להיחנק.

אם אין לכם כרטיס מתאים או שאתם בונים שירות שצריך לשרת אלפי פניות במקביל, עדיף לפנות לפתרונות ענן מנוהלים. המודל הזה מיועד בעיקר למי שרוצה שהמידע לא ייצא מהמחשב שלו.

from transformers import pipeline

pipe = pipeline("text-generation", model="anon8231489123/vicuna-13b-GPTQ-4bit-128g")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המודל. במצב כזה אסור להשתמש בו במוצר מסחרי, כי אין שום אישור משפטי להפצה או לשימוש עסקי, והמקורות שעליהם הוא מתבסס כוללים מגבלות משלהם. זה מתאים רק לבדיקות ולשימוש אישי.

הרישיון המלא בעמוד המודל ↗