GPT
M

Mistral-7B-Instruct-v0.1-GPTQ

קוד פתוח

TheBlokeapache-2.02023-09-28

  • transformers
  • safetensors
  • mistral
  • text-generation
  • finetuned

גרסה מכווצת של מודל ההוראות הפופולרי, שרצה ישירות על כרטיס מסך ביתי אחד. מקבלים חלון הקשר של 32 אלף טוקנים בנפח של ארבעה גיגהבייט בלבד.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 3.9 GBמשקל הקבצים
  • 8,885הורדות בחודש

מה זה

המודל מבוסס על הארכיטקטורה של מיסטרל בגודל 7.2 מיליארד פרמטרים, שעברה כיוונון עדין למענה על הוראות ושיחה. היוצר TheBloke המיר אותו לפורמט GPTQ עם כיול על בסיס wikitext, מה שמאפשר להריץ אותו בזיכרון וידאו נמוך בלי לאבד את היכולת לעקוב אחרי פרומפטים מורכבים. הוא משתמש בטכנולוגיות כמו Grouped-Query Attention וחלון קשב מחליק, שתומכות בעיבוד טקסטים ארוכים ביעילות גבוהה ביחס לגודלו.

בניגוד למודלים ישנים באותו סדר גודל, כאן מקבלים תמיכה מלאה ברצפים ארוכים של עד 32,768 טוקנים. זה אומר שאפשר לטעון לתוכו מסמכים שלמים, קטעי קוד ארוכים או היסטוריית שיחה ענפה, והוא ימשיך לענות בלי לקרוס או לדרוש מערך שרתים כבד.

מתאים ל

  • מענה על מסמכים ארוכים

    חלון של 32 אלף טוקנים מאפשר להזין חוזים ומסמכים טכניים שלמים לקבלת תמצות ישיר בכרטיס מסך בודד.

  • בוט שיחה מקומי

    המודל אומן ספציפית על הוראות ושיחות, ולכן עונה בצורה עקבית ומדויקת לפניות משתמשים לפי תבנית מוגדרת.

  • עיבוד טקסט פנימי בארגון

    הנפח הנמוך והרישיון הפתוח מאפשרים להריץ משימות סיווג וניתוח טקסט על שרת מקומי בלי להוציא מידע החוצה.

איפה זה נופל

ליוצרי המודל אין מנגנוני סינון ובקרה מובנים. הוא נוטה לפלוט תוכן לא מצונזר אם מבקשים ממנו, ולכן אי אפשר לחבר אותו ישירות למשתמשי קצה בלי שכבת בדיקה חיצונית.

מעבר לכך, מדובר בגרסה הראשונה של המודל, ובמועד הוצאתה התמיכה בספריות כמו AutoGPTQ דרשה התקנות ישירות מגיטהאב עקב חוסר תאימות של הארכיטקטורה החדשה, מה שעלול לייצר תקלות בהטמעה בסביבות ישנות.

אותה משפחה

Mistral יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יעבוד ישירות מתוך AutoGPTQ הרגיל?

לא באופן אוטומטי בגרסאות הישנות. כשהמודל שוחרר נדרשה התקנה ספציפית של transformers ישירות מקוד המקור מגיטהאב כדי לזהות את הארכיטקטורה של מיסטרל, או שימוש בטוען של ExLlama v1.

באיזו גרסה מהקבצים כדאי לבחור לשרת פיתוח רגיל?

הגרסה שבענף הראשי מספקת את האיזון הטוב ביותר. היא שוקלת 4.16 גיגהבייט, משתמשת בכימות של ארבעה ביט עם group size של 128, ומאפשרת מהירות עיבוד גבוהה תוך שמירה על צריכת זיכרון מינימלית.

איך מריצים

בשביל להריץ את גרסת ברירת המחדל בארבעה ביט דרוש כרטיס מסך עם לפחות שישה עד שמונה גיגהבייט זיכרון וידאו. אם אתם רוצים דיוק גבוה יותר, קיימות בתיקייה גרסאות שמונה ביט שדורשות סביב עשרה גיגהבייט זיכרון וידאו, וכן גרסאות עם group size של 32 שמנצלות את הכרטיס עד הקצה בשביל אובדן איכות מינימלי.

ההרצה מתבצעת בעיקר דרך ExLlama גרסה ראשונה או ישירות דרך ספריית transformers של פייתון יחד עם ספריות התמיכה optimum ו־auto-gptq. המודל דורש תבנית פרומפט קבועה עם תגיות מיוחדות של INST, כך שחובה להקפיד עליהן בקוד כדי לקבל תשובות הגיוניות.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Mistral-7B-Instruct-v0.1-GPTQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשלב אותו במוצרים פנימיים או חיצוניים, לשנות אותו ולהפיץ אותו בחופשיות. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗