GPT
M

Mistral-7B-Instruct-v0.2-GGUF

קוד פתוח

TheBlokeapache-2.02023-12-11

  • transformers
  • gguf
  • mistral
  • finetuned
  • text-generation

גרסת קוונטיזציה של Mistral שרצה מקומית על מחשב רגיל בלי שרת יקר. מתאים למי שצריך מודל הוראות יעיל וזריז בפורמט GGUF.

  • 51.2 GBמשקל הקבצים
  • 43,586הורדות בחודש
  • 517לייקים

מה זה

המאגר כולל קובצי GGUF של מודל ההוראות Mistral בגודל 7B בגרסה 0.2, לאחר שעבר המרה ודחיסה ברמות שונות. הוא מבוסס על הארכיטקטורה של Mistral הכוללת Grouped-Query Attention וחלון קשב גולש, ומיועד לעבודה ישירה מול פרומפטים בפורמט שיחה מוגדר.

היתרון המעשי כאן הוא היכולת לבחור בדיוק את רמת הדחיסה המתאימה לחומרה שלכם, החל מגרסאות 2 ביט זעירות ועד 8 ביט כבדות. גרסת 0.2 משפרת את המעקב אחר הנחיות בהשוואה לגרסה הראשונה, ומאפשרת שימוש בכלים מקומיים מוכרים כמו llama.cpp בלי להתעסק בהמרות משקל ידניות.

מתאים ל

  • הרצה מקומית על מחשב אישי

    רץ ישירות על מעבדים ביתיים וכרטיסי מסך צרכניים בעזרת llama.cpp או LM Studio.

  • שרת צד לקוח קל משקל

    מאפשר הקמת שרת פנימי קומפקטי בסגנון OpenAI דרך llama-cpp-python בלי עלויות ענן.

  • עיבוד טקסט אוטומטי במערכות

    מבצע ניתוח ועיבוד פקודות בצינורות מידע בעזרת חיבור ישיר ל־LangChain.

איפה זה נופל

למודל אין מנגנוני סינון או בדיקת תוכן מובנים, כפי שמציינים המפתחים שלו. הוא עלול לייצר פלטים בעייתיים ללא פיקוח חיצוני, ולכן אסור להשתמש בו במוצר סופי שפונה למשתמשי קצה בלי לבנות שכבת בקרה נפרדת. בנוסף, גרסאות הדחיסה הנמוכות כמו Q2_K מאבדות איכות משמעותית ואינן מתאימות לשימוש רציני.

אותה משפחה

Mistral יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל 15 הקבצים שבמאגר?

ממש לא. המאגר מכיל רמות שונות של דחיסה, ומספיק להוריד קובץ אחד בלבד שמתאים למגבלות הזיכרון שלכם. הבחירה המאוזנת לרוב המשתמשים היא mistral-7b-instruct-v0.2.Q4_K_M.gguf.

איך מעבירים לו פקודות נכון?

המודל דורש מבנה קלט ספציפי של תגיות INST. יש לעטוף את ההנחיה בפורמט הקבוע של המודל כדי לקבל תוצאות מדויקות ולא לשבור את אופן המענה שלו.

איך מריצים

בשביל להריץ אותו צריך קובץ בודד בלבד ולא את כל המאגר. גרסת Q4_K_M שוקלת 4.37 גיגה בייט ודורשת כמעט 6.9 גיגה בייט זיכרון כדי לפעול על המעבד, אם כי מומלץ להעביר שכבות לכרטיס מסך כדי לשפר ביצועים באמצעות llama.cpp או ספריות כמו llama-cpp-python. אם יש לכם מעט זיכרון, גרסאות כמו Q3_K_M ידרשו סביב 6 גיגה בייט, אך יפגעו באיכות הפלט.

אם אתם לא רוצים לנהל חומרה מקומית, לתחזק דרייברים או להקצות משאבי מעבד וזיכרון ייעודיים, שירות ענן חיצוני פשוט יותר לתפעול.

ollama run hf.co/TheBloke/Mistral-7B-Instruct-v0.2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ותנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗