GPT
M

bartowski/Mistral-Nemo-Instruct-2407-GGUF

קוד פתוח

bartowskiapache-2.02024-07-18

  • gguf
  • text-generation
  • en
  • fr
  • de

גרסת GGUF מוכנה לשימוש מקומי של דגם ההוראות מבית מיסטרל. הוא מציע פתרון קומפקטי שמכוון למגוון שפות רחב ורץ בקלות יחסית על מחשבים אישיים ושרתים צנועים.

  • 225 GBמשקל הקבצים
  • 18,553הורדות בחודש
  • 125לייקים

מה זה

מדובר בהמרה של המודל המקורי לתבנית GGUF באמצעות llama.cpp, שכוללת כיול imatrix לשיפור הדיוק ברמות דחיסה שונות. הוא מיועד למשימות יצירת טקסט ומענה להוראות, ומגיע עם תמיכה מוצהרת בשמונה שפות: אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, רוסית וסינית.

היתרון הגדול של המאגר הזה הוא המגוון הרחב של רמות הדחיסה, מקובץ F16 מלא ששוקל 24.50 גיגה בייט ועד גרסאות מכווצות של פחות מ־5 גיגה בייט. יש כאן גם גרסאות ייעודיות שמותאמות לארכיטקטורת ARM, לצד קבצים ששומרים על משקל גבוה יותר בשכבות הקלט והפלט כדי לצמצם את אובדן הדיוק שקורה בדרך כלל בכיול אגרסיבי.

מתאים ל

  • עוזר מקומי פרטי

    הרצה מקומית ב־LM Studio בלי לשלוח שום מידע החוצה, בשימוש בשפות אירופיות או אנגלית.

  • עיבוד טקסט רב־לשוני

    תרגום ומענה להוראות בשפות כמו צרפתית, רוסית או סינית שנתמכות באופן רשמי.

  • הסקה על שרתי ARM

    ניצול קובצי Q4_0 הייעודיים להאצת ביצועים על גבי מעבדי ARM תואמים.

איפה זה נופל

עברית לא מופיעה ברשימת השפות הנתמכות של המודל, ולכן כל שימוש בשפה המקומית דורש בדיקה מעמיקה שלכם לגבי איכות הפלט וההבנה שלו. בנוסף, גרסאות הדחיסה הנמוכות מאוד, כמו Q2_K או Q3_K_S, מוגדרות באיכות נמוכה ולא מתאימות למשימות רגישות שדורשות דיוק.

יש גם מגבלות תאימות טכניות. קובצי ה־ARM המותאמים אינם מיועדים למערכות Mac או Windows, ופורמטים מסוג IQ אינם נתמכים אם אתם מריצים Vulkan על גבי כרטיסי AMD.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד?

ההמלצה הכללית לרוב המקרים היא Q4_K_M ששוקל 7.48 גיגה בייט. הוא נותן איזון מעולה בין איכות פלט לדרישות זיכרון ומתאים לרוב כרטיסי המסך הביתיים.

איך משתמשים במודל נכון בממשק?

המודל מאומן על מבנה שיחה מסוים מאוד. אתם צריכים לעטוף את ההנחיה שלכם בפורמט התואם לפי ההוראות, כלומר תגית פתיחה של INST ולאחריה סגירה, כדי לקבל תשובות עקביות.

איך מריצים

אתם יכולים להוריד קובץ בודד בעזרת huggingface-cli ולהריץ אותו ישירות בתוכנות כמו LM Studio או דרך llama.cpp. בשביל ביצועים טובים עדיף לבחור קובץ שקטן בגיגה או שניים מנפח הזיכרון של כרטיס המסך שלכם, כדי לטעון את כולו ל־VRAM.

גרסת Q4_K_M שוקלת 7.48 גיגה בייט והיא נקודת הפתיחה המאוזנת לרוב המשתמשים עם כרטיס מודרני. אם אין לכם חומרה ייעודית ואתם צריכים גרסאות זעירות כמו IQ2_M, האיכות תרד באופן מורגש, ובמקרים כאלה משתלם יותר לשלם לספק ענן על קריאות API מאשר להריץ מקומית על מעבד חנוק.

ollama run hf.co/bartowski/Mistral-Nemo-Instruct-2407-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקבצים והפצה שלהם בתוך מוצרים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗