GPT
M

Mistral-7B-Instruct-v0.1-GGUF

קוד פתוח

TheBlokeapache-2.02023-09-27

  • transformers
  • gguf
  • mistral
  • finetuned
  • text-generation

גרסת GGUF מכווצת למודל ההוראות של מיסטרל, שנועדה לאפשר הרצה מקומית ומהירה על מעבד רגיל או כרטיס מסך פשוט.

  • 51.2 GBמשקל הקבצים
  • 29,716הורדות בחודש
  • 614לייקים

מה זה

הפרויקט הזה מנגיש את מודל ההוראות Mistral 7B בפורמט GGUF, מה שמאפשר להריץ אותו ישירות דרך ספריות כמו llama.cpp בלי להזדקק לתשתית שרתים מורכבת.

המפרסם דחס כאן את המשקלים של המודל המקורי למגוון רמות דיוק, החל מכיול של שתי סיביות ועד שמונה סיביות. המטרה היא לאפשר התאמה מדויקת בין מגבלות הזיכרון שלכם לבין רמת הדיוק של הטקסט שנוצר, כך שתוכלו לקבל מודל שיחה עובד גם על חומרה צנועה.

הקובץ המאוזן והמומלץ ביותר בדף הוא Q4_K_M, ששוקל 4.37 גיגה בייט ומספק פשרה יציבה בין איכות הפלט לנפח הזיכרון הנדרש בפועל.

מתאים ל

  • בוט שיחה עצמאי במחשב

    הרצה מקומית מלאה של עוזר אישי דרך ממשקים גרפיים כמו LM Studio בלי שליחת מידע החוצה.

  • פיתוח יישומים מבוססי פייתון

    שילוב יכולות טקסט בכלים פנימיים באמצעות llama-cpp-python ללא תלות ברשת.

  • ניסויי שפה על חומרה חלשה

    בדיקת יכולות המודל במחשבים ללא כרטיס מסך ייעודי הודות לחלוקה לעומסי מעבד וזיכרון נמוכים.

איפה זה נופל

הקוד הנוכחי של GGUF בדף זה אינו תומך במנגנון חלון ההקשר הנגלל של מיסטרל. המשמעות היא שאורך הקלט והפלט מוגבל בקשיחות לעד 4096 טוקנים בלבד, וכל ניסיון לחרוג מזה ייכשל או יניב פלט משובש.

מעבר לזה, גרסאות הכיווץ הנמוכות ביותר כמו Q2_K או Q3_K מגיעות עם אובדן איכות משמעותי מאוד, כך שהן לא מתאימות למי שצריך תוצאות עקביות ומדויקות.

אותה משפחה

Mistral יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל 15 הקבצים מהמאגר?

ממש לא, אתם צריכים לבחור קובץ יחיד בלבד שתואם את נפח הזיכרון והחומרה שלכם. הורדת כל הקבצים סתם תבזבז מעל חמישים גיגה בייט של מקום בדיסק.

איזה קובץ מומלץ לבחור לשימוש יומיומי?

הגרסה המאוזנת ביותר היא Q4_K_M שדורשת 6.87 גיגה בייט זיכרון בעבודה על מעבד. אם יש לכם יותר זיכרון פנוי ואתם רוצים פחות פגיעה באיכות, לכו על Q5_K_M.

האם המודל תומך בהקשר ארוך מעל 4096 טוקנים?

כרגע לא בגרסה הזו. הפורמט בדף אינו תומך במנגנון החלון הנגלל של המודל המקורי, ולכן הריצה מוגבלת לתקרה של 4096 טוקנים בלבד.

איך מריצים

טוענים קובץ בודד שמתאים לחומרה שלכם לתוך תוכנות תומכות כמו LM Studio, Faraday.dev או ישירות דרך שורת הפקודה עם llama.cpp. הדרישות מתחילות מזיכרון עבודה של 5.58 גיגה בייט עבור הגרסה המכווצת ביותר ומגיעות עד 10.20 גיגה בייט עבור גרסת Q8_0, בהנחה שמריצים על המעבד בלבד ללא כרטיס מסך.

אם יש לכם כרטיס מסך עם מספיק זיכרון ייעודי, תוכלו להעביר אליו חלק מהשכבות או את כולן כדי להאיץ משמעותית את מהירות הפקת הטקסט. מי שמחפש פתרון קל לפיתוח בפייתון יכול להשתמש בספריות ctransformers או llama-cpp-python, אם כי ctransformers עשויה לדרוש הגדרת סוג מודל חלופי לפי התיעוד.

ollama run hf.co/TheBloke/Mistral-7B-Instruct-v0.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש במוצרים סגורים או פתוחים, כל עוד שומרים על הודעות זכויות היוצרים והתנאים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗