GPT
M

Mistral-7B-Instruct-v0.2-GPTQ

קוד פתוח

TheBlokeapache-2.02023-12-11

  • transformers
  • safetensors
  • mistral
  • text-generation
  • finetuned

גרסת GPTQ מכווצת של מודל ההוראות הפופולרי מבית מיסטרל. היא מאפשרת להריץ מודל טקסט מוכח של שבעה מיליארד פרמטרים על כרטיס מסך ביתי בודד בלי לחנוק את הזיכרון.

  • 7.2Bפרמטרים
  • 32,768טוקנים בהקשר
  • 3.9 GBמשקל הקבצים
  • 4,252הורדות בחודש

מה זה

מדובר בהמרה שביצע TheBloke למודל ההוראות המקורי של Mistral AI בגרסה שתיים. המטרה כאן היא לאמן פחות ולדחוף יותר לתוך זיכרון הווידאו, באמצעות דחיסה לארבע או שמונה סיביות. המודל שומר על חלון הקשר נדיב של 32,768 טוקנים, מה שמאפשר לעבד איתו טקסטים ארוכים יחסית לגודלו, ומשתמש במבנה של Grouped-Query Attention וחלון תשומת לב מחליק.

היתרון הגדול מול גרסאות הציפה המקוריות הוא היעילות. במקום לשלם על כרטיסי שרת יקרים כדי להריץ מודל של שבעה מיליארד פרמטרים, קובצי המשקל שוקלים בין 4.16 ל־8.17 גיגה־בייט בהתאם לגרסת הדחיסה. המודל מכויל לעבודה לפי תבנית הוראות מוגדרת היטב, ומחזיר ביצועים טובים יותר במעקב אחרי הנחיות לעומת גרסה אפס נקודה אחת שקדמה לו.

מתאים ל

  • בוט הוראות פנימי

    מענה לפקודות מוגדרות בתבנית שיחה על גבי כרטיס גרפי צנוע בלי להוציא מידע מהרשת הארגונית.

  • תמצות מסמכים ארוכים

    חלון הקשר של שלושים ושניים אלף טוקנים מאפשר לקרוא קבצים כבדים ולחלץ מהם נקודות מפתח.

  • פיתוח שרת בדיקות מקומי

    הקמה מהירה של שרת TGI מבוסס דוקר בלי תלות בעלויות קריאה לשרתים חיצוניים.

איפה זה נופל

היוצרים במיסטרל מודים בפירוש שלמודל אין שום מנגנון ניטור או סינון פנימי. הוא לא כולל מעקות בטיחות, ופולט טקסט ישירות לפי הקלט בלי לבדוק התאמה לסביבה מפוקחת, כך שאסור לחבר אותו למוצר מול לקוחות בלי שכבת סינון חיצונית. בנוסף, כיול ה־GPTQ בוצע עם אורך רצף של 4,096 טוקנים בלבד על מאגר VMware Open Instruct, מה שאומר שבקצוות הרחוקים של חלון ההקשר המלא ייתכנו ירידות בדיוק.

אותה משפחה

Mistral יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יעבוד על מחשבי מק עם שבבי אפל סיליקון?

לא דרך הקבצים האלה. קובצי ה־GPTQ מותאמים לכרטיסי אנבידיה ו־AMD, ואינם נתמכים ב־macOS. אם אתם עובדים על מק, עליכם להוריד את גרסאות ה־GGUF של המודל.

מה ההבדל המעשי בין גרסת main לגרסאות האחרות במאגר?

גרסת main מציעה איזון של ארבע סיביות עם קבוצות של 128, שתופסת כ־4.16 גיגה זיכרון ותומכת בטעינה מהירה דרך ExLlama. גרסאות השמונה סיביות מדויקות מעט יותר אך שוקלות כמעט כפול ולא נתמכות במנוע זה.

האם חייבים להשתמש בתבנית מסוימת כדי לדבר עם המודל?

כן, המודל אומן ספציפית להגיב לתגיות INST וסגירתן. אם תזינו טקסט חופשי בלי התבנית הזו, איכות התשובות והיכולת שלו לעקוב אחרי הוראות תרד בצורה משמעותית.

איך מריצים

קובצי ה־GPTQ מיועדים להרצה ישירה על גבי מעבדים גרפיים של אנבידיה בווינדוס או לינוקס, ועל כרטיסי AMD בלינוקס בלבד. משתמשי מק צריכים לפנות לגרסאות GGUF. גרסת ברירת המחדל בארבע סיביות שוקלת כ־4.16 גיגה־בייט ותרוץ היטב על כרטיס מסך עם שישה עד שמונה גיגה זיכרון וידאו, במיוחד אם טוענים אותה דרך ExLlama שנתמך בכל גרסאות הארבע סיביות כאן.

אם אתם צריכים דיוק מרבי, ישנן גרסאות שמונה סיביות שדורשות סביב עשרה גיגה זיכרון ומעלה ולא תומכות ב־ExLlama. אפשר לחבר אותו לכלי שרת כמו TGI של Hugging Face או ממשק כמו text-generation-webui. אם אין לכם חומרה ייעודית עם מאיץ גרפי זמין, עדיף להשתמש ב־API מרוחק במקום להסתבך עם התקנות מקומיות של AutoGPTQ ודרייברים.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Mistral-7B-Instruct-v0.2-GPTQ")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון אפאצ'י שתיים נקודה אפס. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או חיצונית בתוך מוצר, ללא תמלוגים. התנאי העיקרי הוא שמירה על הצהרת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗