GPT
M

Mistral-7B-Instruct-v0.2-AWQ

קוד פתוח

TheBlokeapache-2.02023-12-11

  • transformers
  • safetensors
  • mistral
  • text-generation
  • finetuned

גרסת 4 ביט מהירה למודל ההוראות של מיסטרל, מכווצת בשיטת AWQ. היא מיועדת למי שרוצה להרים שרת מבוסס vLLM או TGI על כרטיס מסך בודד בלי לשלם על מודל ענק.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 3.9 GBמשקל הקבצים
  • 126,169הורדות בחודש

מה זה

מדובר בגרסה מכווצת של מודל ההוראות v0.2 של Mistral AI עם 7.2 מיליארד פרמטרים, שעברה קוונטיזציה על ידי TheBloke בשיטת AWQ ברמת 4 ביט. השיטה הזו שומרת על המשקלים החשובים של המודל, ומציגה ביצועי הסקה טובים ומהירים יותר בטעינה ישירה לספריות תשתית בהשוואה לשיטות ותיקות כמו GPTQ.

המודל מגיע עם חלון הקשר של 32,768 טוקנים, תכונה שמרחיבה משמעותית את כמות המידע שאפשר לנתח בבקשה אחת לעומת גרסאות בסיסיות קודמות. הוא בנוי על ארכיטקטורת Mistral עם מנגנוני קשב יעילים כמו Grouped-Query Attention ודורש תבנית פנייה מסוימת עם תגיות INST כדי להפיק תשובות מדויקות להוראות המשתמש.

מתאים ל

  • הסקה מהירה בשרתי ייצור

    חיבור ישיר ל־vLLM מנצל את מבנה ה־AWQ כדי לספק קצב טוקנים גבוה בצריכת זיכרון נמוכה.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 32k טוקנים מאפשר להזין טקסטים נרחבים בלי לחתוך אותם לחלקים קטנים.

  • בוט הוראות פנימי בארגון

    ריצה מקומית על כרטיס בודד שומרת על המידע בתוך הרשת בלי להוציא נתונים לשירותי ענן.

איפה זה נופל

המגבלה המרכזית שהמפתחים מדגישים היא היעדר מנגנוני סינון ובקרה מובנים. המודל פולט תשובות ישירות בלי שכבת מתינות, מה שאומר שהוא עלול לייצר תוכן לא הולם או מסוכן אם לא תשימו מולו מנגנון הגנה משלכם. בנוסף, תהליך הכיווץ הנוכחי שחרר גרסה אחת בלבד עם גודל קבוצה 128, וחלון הכיול של הדאטהסט בזמן ההמרה עמד על 4096 טוקנים בלבד, כך שצריך לבדוק היטב איך הוא מגיב בקצוות הקיצוניים של חלון ההקשר המלא.

אותה משפחה

Mistral יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

אפשר להריץ את המודל על מחשב מק עם מעבד סיליקון?

לא. המימוש הנוכחי של AWQ מוגבל לכרטיסי מסך של NVIDIA בלבד בסביבת לינוקס או ווינדוס. למשתמשי Mac מומלץ לחפש את גרסאות ה־GGUF של אותו מודל שמיועדות לריצה על מעבדים משולבים.

איך צריך לנסח את הבקשות כדי שהמודל יבין נכון?

המודל עבר אימון הוראות ומחייב תחביר קשיח. יש לעטוף כל בקשה בתגיות מיוחדות של פתיחה וסגירה לפי המבנה שמיסטרל הגדירה, אחרת איכות הפלט וההבנה של ההנחיות ייפגעו בצורה מורגשת.

איך מריצים

כדי להריץ את הקבצים צריך מחשב עם לינוקס או ווינדוס וכרטיס מסך מבית NVIDIA בלבד, משום ש־AWQ לא עובד על מעבדי אפל ומחייב סביבת CUDA. כיוון שהקבצים שוקלים קצת פחות מארבעה גיגהבייט, כרטיס מסך סטנדרטי עם 8 או 12 גיגהבייט של VRAM מספיק כדי לטעון אותו לזיכרון ולהריץ הסקה מהירה בלי בעיה.

הספריות הנוחות ביותר לעבודה איתו בייצור הן vLLM או Hugging Face TGI, שמאפשרות לתשאל אותו דרך שרת מקומי. אם אין לכם חומרת GPU מתאימה של NVIDIA או שאתם עובדים על מחשבי Mac, מוטב לפנות לגרסאות GGUF או לשלם ישירות לספק API חיצוני במקום לנסות לייצב סביבה כזו.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Mistral-7B-Instruct-v0.2-AWQ")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והודעת הרישיון המקורית, בלי אחריות מצד היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗