GPT
D

dolphin-2.5-mixtral-8x7b-GGUF

קוד פתוח

TheBlokeapache-2.02023-12-14

  • transformers
  • gguf
  • mixtral
  • en
  • conversational

גרסת GGUF מכווצת של מודל Mixtral 8x7B שעבר כוונון ללא צנזורה וללא סינוני בטיחות. היא פונה למי שמחפש מודל קוד ושיחה חזק שמבצע הוראות בלי להתווכח.

  • 225 GBמשקל הקבצים
  • 18,118הורדות בחודש
  • 314לייקים

מה זה

מדובר בהמרה של TheBloke לקובצי GGUF מתוך האימון של אריק הרטפורד על בסיס Mixtral 8x7B. המודל עבר כוונון ייעודי למשימות תכנות בעזרת מאגרי מידע כמו Dolphin-Coder ו־MagiCoder, לצד שילוב סטים דוגמת Synthia ו־OpenHermes. הוא מתמקד בצייתנות גבוהה מאוד להנחיות המשתמש בתבנית ChatML.

ההבדל המרכזי מול מודלים אחרים בארכיטקטורה הזו הוא הסרת שכבות היישור וההטיה המובנות. הכותב אימן אותו באורך הקשר של 16k טוקנים, לעומת 32k של מודל הבסיס. הוא מגיב ישירות בלי הטפות מוסר, אך מאחר שלא עבר כוונון DPO, לעיתים נדרש חיזוק בהנחיית המערכת כדי להביא אותו לדיוק מרבי.

מתאים ל

  • עוזר פיתוח וכתיבת קוד

    הוא כולל אימון נרחב על מאגרי קוד ייעודיים ומספק פתרונות תכנות מורכבים ללא סירובים.

  • הרצת סוכן פנימי לא מצונזר

    הוא מציית ישירות להנחיות מערכת קשיחות בלי להתחמק ממשימות או לסנן תוכן.

  • ניתוח טקסטים ארוכים עד 16k

    הוא תומך בחלון הקשר רחב ומאפשר לעבד מסמכים טכניים שלמים בהרצה מקומית.

איפה זה נופל

היוצר מציין מפורשות שהמודל לא מצונזר לחלוטין ויענה לכל בקשה, כולל בקשות לא אתיות. אסור לחבר אותו לממשק משתמש חיצוני בלי שכבת בדיקה וסינון עצמאית. בנוסף, חלון ההקשר אומן על 16k בלבד, ובגלל היעדר אימון DPO יש מקרים שבהם הוא דורש הנחיות מערכת אגרסיביות כדי לציית לפקודות מורכבות.

אותה משפחה

dolphin-2.5-mixtral יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

האימון והכוונון שלו מוגדרים עבור השפה האנגלית בלבד. אף על פי שארכיטקטורת הבסיס מזהה מילים בעברית, הביצועים שלו בשפה זו נמוכים בהרבה, והוא לא מיועד למשימות כתיבה מקומיות.

איזו גרסת כיול כדאי להוריד לשימוש כללי?

הגרסה המאוזנת ביותר היא Q4_K_M. היא מציעה פשרה מדויקת בין צריכת זיכרון של כ־29 גיגה בייט לבין איכות מענה, בלי הירידה החדה בביצועים שקיימת בגרסאות ה־2 וה־3 ביט.

למה המודל דורש הגדרות מיוחדות ב־System Prompt?

היוצר לא שילב שלב כוונון DPO באימון. בשל כך, המודל זקוק לעיתים לתמרוץ מפורש בהנחיית המערכת הראשונית כדי להישאר צייתן לחלוטין ולענות על שאלות ללא היסוס.

איך מריצים

כדי להריץ אותו צריך כלי שתומך בפורמט כמו llama.cpp, KoboldCpp מגרסה 1.52 ומעלה, או LM Studio מגרסה 0.2.9. למחשב ממוצע אין מספיק זיכרון בשבילו, שכן הגרסה המאוזנת המומלצת, Q4_K_M, שוקלת כ־26.44 גיגה בייט ודורשת קרוב ל־29 גיגה בייט זיכרון רק למודל ללא פריקה לכרטיס מסך.

גרסאות ה־2 ביט וה־3 ביט הקטנות גורמות לאובדן איכות ניכר, בעוד גרסאות כמו Q6_K או Q8_0 מגיעות ליותר מ־40 ו־52 גיגה בייט זיכרון בהתאמה. אם אין לכם מעבד חזק עם עשרות גיגות זיכרון RAM או כרטיסי מסך עם מספיק זיכרון ייעודי כדי לפרוק שכבות, ההרצה המקומית תהיה איטית ביותר.

ollama run hf.co/TheBloke/dolphin-2.5-mixtral-8x7b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה חופשית, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗