GPT
M

MIstral-QUantized-70b_Miqu-1-70b-iMat.GGUF

קוד פתוח

NexesQuantsרישיון לא דווח2024-01-29

  • gguf
  • endpoints_compatible
  • conversational

גרסה מכווצת ומדויקת להדלפה המוכרת של Mistral Medium Alpha. תקבלו כאן ביצועים ברמה של מודל שבעים מיליארד מאומן היטב, עם צנזורה נמוכה ויכולת חזקה בצרפתית.

  • 643 GBמשקל הקבצים
  • 5,465הורדות בחודש
  • 70לייקים

מה זה

המודל הזה הוא תוצר של כיול מחדש בשיטת iMatrix מתוך גרסת Q5_K_M קודמת שהודלפה. היוצר השתמש במטריצת כיול של 12,800 טוקנים מתוך wiki.train.raw כדי לכווץ את המשקלים בלי לאבד חדות. הוא מגיע עם חלון הקשר מקורי של 32k טוקנים וערך תטא של מיליון, כך שאין צורך במשחקי RoPE או התאמות תדרים כדי להגיע לקצה הטווח.

במבחני ביצועים, ההבדל מול מתחרים בולט. גרסת Q3_K_M מגיעה לתוצאה של 88.1 ב־Hellaswag וציון של 50.15 ב־MMLU. לשם השוואה, CodeLlama 70b באותה רמת כימות מגרד את ה־36.1 ב־MMLU ונופל משמעותית בפרפלקסיטי. המודל שומר על היגיון בריא, לא סובל מהתאמת יתר, ומציג דיוק שמשאיר מאחור ניסיונות הרחבה מקבילים של Llama 2.

מתאים ל

  • מחקר והרצה מקומית

    מאפשר לבדוק יכולות של Mistral Medium על חומרה מקומית בלי תלות ברשת או דיווח לשרתי צד שלישי.

  • שיחה ועיבוד בצרפתית

    היוצר מעיד על שליטה חזקה בשפה הצרפתית ללא תחושה של בוט עילג, יתרון שלא קיים בכל מודל קוד פתוח.

  • בדיקת שיטות כימות

    כר פורה להשוואת ביצועים בין iMatrix, IQ3_XXS ודחיסות קיצוניות של 1 ביט תחת עומסי הקשר שונים.

איפה זה נופל

הבעיה המרכזית היא הירידה החדה ביכולות כשדוחפים את המודל לכימותים נמוכים מדי. בגרסאות ה־IQ1 ציון ה־MMLU מתרסק לאזור ה־38 עד 41, וערכי הפרפלקסיטי מטפסים מעל 6.2, מה שאומר שהמודל מייצר הרבה יותר שגיאות גסות. בנוסף, מדובר במודל לא רשמי שמבוסס על גרסת אלפא מוקדמת, ללא תמיכה מסודרת וללא תיעוד על נתוני האימון המקוריים שלו. אין כאן שום אחריות על יציבות הפלטים.

שאלות
נפוצות

האם כדאי להוריד את גרסאות ה־IQ1 כדי לחסוך מקום?

לא מומלץ למשימות שדורשות חשיבה או דיוק עובדתי. הציונים במבחנים מראים צניחה חופשית בכל המדדים לעומת גרסאות שלוש או ארבע ביט, ועדיף להריץ מודל קטן יותר בצורה מלאה מאשר מודל שבעים מיליארד מסורס לחלוטין.

איך המודל מתמודד עם טקסטים ארוכים?

הוא מוגדר מראש לעבודה עד 32k טוקנים הודות לערך תטא של מיליון. המשמעות היא שאין צורך להגדיר הרחבות כמו Yarn או לשנות מקדמי תדר בהגדרות ההרצה, והוא שומר על פרפלקסיטי יציב גם בטווחים האלה.

אפשר להטמיע את המודל במערכת של החברה?

ממש לא. אין רישיון מוצהר ומקור המשקלים הוא הדלפה לא מורשית. הכנסה של מודל כזה לקוד ייצור פותחת פתח לבעיות משפטיות חמורות מול החברה המפתחת.

איך מריצים

בשביל להריץ את המודל בהרצה מלאה על כרטיס המסך תצטרכו להתאים את גרסת הקובץ לחומרה שלכם. גרסאות Q4_K_S דורשות 48GB זיכרון גרפי, גרסאות כמו Q3_K_M או IQ3_XXS נכנסות ב־36GB VRAM, ואילו גרסאות ה־IQ1 המכווצות במיוחד מאפשרות דחיפה לכרטיסי 16GB VRAM בודדים.

הריצה בפועל נעשית דרך llama.cpp או גרסה מותאמת של Kobold.CPP שתומכת בפורמטים החדשים. אם אין לכם לפחות כרטיס RTX 3090 או A6000 פנוי, או אם אתם צריכים תפוקה יציבה לכמות משתמשים גדולה, עדיף להשתמש ב־API חיצוני של שירות ענן במקום להילחם בדחיקת שכבות לזיכרון המחשב.

ollama run hf.co/NexesQuants/MIstral-QUantized-70b_Miqu-1-70b-iMat.GGUF:Q4_K_S

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 643 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון לא דווח בעמוד המודל. היות שמדובר במשקלים שמקורם בהדלפה של Mistral Medium Alpha, השימוש בו במוצר מסחרי או באפליקציה פתוחה חושף אתכם לתביעות קניין רוחני והפרת זכויות יוצרים. הכלי מתאים לבדיקות פנימיות ולמחקר בלבד.

הרישיון המלא בעמוד המודל ↗