GPT
M

QuantFactory/Mistral-Nemo-Instruct-2407-GGUF

קוד פתוח

QuantFactoryapache-2.02024-07-19

  • gguf
  • en
  • fr
  • de
  • es

גרסה מכווצת של מודל ההוראות שמיסטרל ואנווידיה פיתחו יחד. הוא מביא חלון הקשר ענק של 128 אלף טוקנים כחלופה ישירה לדגמי שבעה מיליארד פרמטרים ישנים.

  • 103 GBמשקל הקבצים
  • 2,073הורדות בחודש
  • 51לייקים

מה זה

המודל מבוסס על שיתוף פעולה בין מיסטרל לאנווידיה ומגיע בארכיטקטורה של 40 שכבות עם חלון הקשר של 128 אלף טוקנים. הוא אומן על נתח גדול של קוד ומגוון שפות, ונועד להחליף דגמים קודמים בגזרת שבעה מיליארד פרמטרים בלי לשנות את התשתית הבסיסית שלכם.

במבחני ידע כללי כמו MMLU הוא מגיע לשישים ושמונה אחוזים, ובמשימות כמו HellaSwag הוא חוצה את שמונים ושלושה האחוזים. עם זאת, במבחן NaturalQuestions הוא מקבל רק שלושים ואחד נקודה שני אחוזים, מה שמראה שבשליפת עובדות מדויקות בלי הקשר צמוד עדיין יש לו פערים.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון של 128 אלף טוקנים קולט טקסטים כבדים, סיכומי פגישות ותיעוד טכני נרחב בקריאה אחת.

  • עוזר פיתוח וקוד

    האימון כלל נתח משמעותי של קוד ומאפשר כתיבה, תיקון באגים ומעקב אחר הוראות פיתוח.

  • הרצה מקומית ומאובטחת

    קבצי GGUF מאפשרים להרים מופע מבודד על חומרה מקומית בלי לחשוף מידע לשירותי ענן חיצוניים.

איפה זה נופל

המודל שוחרר ללא מנגנוני ניטור, סינון או מתון מובנים של התוכן, והיוצרים כותבים בפירוש שהוא משמש הדגמה מהירה של יכולות הכוונון. הוא עלול לפלוט מידע שגוי, תוכן פוגעני או תשובות לא הולמות אם לא תעטפו אותו במערכת בדיקה חיצונית.

נוסף על כך, עברית כלל אינה נכללת ברשימת השפות הנתמכות שנבדקו, שכוללת רק אנגלית, רוסית, יפנית, סינית וכמה שפות אירופיות. מבחני הדיוק בשפות אלו נעים סביב שישים אחוזים בלבד.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

עברית אינה מופיעה ברשימת השפות שנבדקו רשמית בכרטיס המודל. המדדים מפרטים תמיכה בשפות אירופיות, רוסית, סינית ויפנית בלבד. אם המוצר שלכם מיועד לשוק המקומי, חובה לבדוק את איכות הפלט וההבנה בעברית לפני שמתקדמים.

למה התשובות שלו מופרעות או לא יציבות?

המפתחים מדגישים שהמודל הזה רגיש לחום גבוה ודורש טמפרטורה נמוכה סביב 0.3 עד 0.35, בניגוד לדגמים קודמים. בנוסף, הוא מגיע בלי מסנני בטיחות כלל, כך שאתם צריכים לסנן את הקלט והפלט בעצמכם אם אתם חושפים אותו למשתמשי קצה.

איך מריצים

הגרסה הזו עברה המרה לפורמט GGUF באמצעות llama.cpp, מה שמאפשר להריץ אותה ישירות על מעבד ומאיצים מקומיים. המאגר כולל 16 קבצים במשקל כולל של 103 גיגה בייט שמכילים רמות כיול שונות, כך שאתם מורידים רק קובץ כיול בודד בהתאם לזיכרון שיש לכם בכרטיס המסך.

המפתחים ממליצים לעבוד עם טמפרטורה נמוכה של 0.3 או 0.35 כדי לשמור על יציבות. אם החומרה המקומית שלכם חלשה מלהחזיק את הקובץ הנבחר בזיכרון או שהביצועים איטיים מדי, פנייה לשירותי ענן שמארחים את המקור תהיה פשוטה בהרבה.

ollama run hf.co/QuantFactory/Mistral-Nemo-Instruct-2407-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אתם רשאים להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו בתוך מוצר סגור ולהפיץ אותו ללקוחות, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של כתב הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗