GPT
D

dolphin-2.7-mixtral-8x7b-GGUF

קוד פתוח

TheBlokeapache-2.02024-01-01

  • transformers
  • gguf
  • mixtral
  • en
  • conversational

גרסה מכווצת בפורמט GGUF למודל Mixtral שפותחה ללא מנגנוני סינון ובלי מטיפי מוסר. מיועדת למי שצריך ציות מוחלט להוראות ויכולות תכנות חזקות על חומרה מקומית.

  • 225 GBמשקל הקבצים
  • 16,592הורדות בחודש
  • 176לייקים

מה זה

מדובר בהמרה של דולפין 2.7, המבוסס על ארכיטקטורת Mixtral 8x7B של MistralAI. המפתח אימן אותו באמצעות qLoRA במשך שלושה ימים על ארבעה כרטיסי A100, תוך שחרור שכבת הניתוב של המומחים כדי לתקן בעיות ביצועים מגרסאות קודמות. הדגש העיקרי כאן הוא אימון על כמויות גדולות של קוד, לצד הסרה שיטתית של נתוני ישור עמדות.

התוצאה היא מודל שמציית להוראות בלי להתווכח ובלי לחסום שאלות על בסיס פוליטיקלי קורקט. הבסיס המקורי תומך בהקשר של 32k, אך האימון הספציפי הזה בוצע על חלון של 16k טוקנים. הוא משתמש בפורמט השיחה ChatML ומציג יכולות ניתוח וכתיבת קוד גבוהות מאוד ביחס למודלים פתוחים אחרים.

מתאים ל

  • עוזר תכנות מקומי

    מתאים לכתיבה וניתוח קוד ישירות על תחנת העבודה, בזכות דאטה־סט ייעודי שעליו אומן.

  • בוט שיחה חופשי מצנזורה

    עונה על כל שאלה בלי לחסום נושאים ובלי להטיף מוסר למשתמש, בזכות סינון מנגנוני הישור.

  • אוטומציה בסביבה סגורה

    רץ מקומית דרך llama.cpp ומאפשר עיבוד מידע רגיש בארגון בלי להוציא נתונים לרשת חיצונית.

איפה זה נופל

היוצר מציין במפורש שהמודל לא עבר תהליך DPO, מה שאומר שלפעמים תצטרכו להנדס פרומפטים מורכבים במיוחד כדי לגרום לו לדייק. מעבר לזה, המודל פועל ללא שום סינון תוכן, כך שהוא ייצר תשובות לכל בקשה כולל דברים מזיקים או לא חוקיים.

לפני שמחברים אותו למערכת חיצונית, חובה לבנות שכבת הגנה משלכם. בנוסף, חלון ההקשר אומן עד 16k בלבד ולא מנצל את מלוא 32k של מודל הבסיס, והנתונים הרשמיים מצביעים על תמיכה באנגלית בלבד ללא התאמה לעברית.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד רגיל?

לא מומלץ לנסות על מחשב סטנדרטי. כדי להריץ את גרסת ברירת המחדל המומלצת צריך כ־29 גיגה של זיכרון פנוי, וגם אז הביצועים על מעבד מרכזי בלבד יהיו אטיים מאוד. תצטרכו מחשב חזק עם שפע זיכרון RAM או כרטיס מסך מקצועי עם זיכרון ייעודי גדול.

למה כרטיס המודל מדגיש שאין לו סינון תוכן?

האימון ניקה בכוונה את כל ההגבלות המלאכותיות שחברות מסחריות שמות על מודלים. המשמעות היא שהמודל יבצע כל פקודה שתתנו לו ללא סירוב, אך גם שהוא עלול לפלוט מידע שגוי או פוגעני. אם אתם בונים מוצר שפונה לקהל רחב, תצטרכו לסנן את הפלטים בעצמכם בקוד המערכת.

איך מריצים

כדי להריץ אותו בלי כרטיס מסך ייעודי, תצטרכו לפחות 29 גיגה זיכרון עבודה עבור גרסת הקיצוץ המאוזנת Q4_K_M, ששוקלת 26.44 גיגה. גרסאות קטנות יותר כמו Q2_K דורשות כ־18 גיגה זיכרון אבל סובלות מאיבוד איכות מורגש, בעוד גרסת ה־8 ביט דורשת יותר מ־52 גיגה.

בפועל, כדאי לפרוק שכבות לכרטיס מסך כדי לקבל מהירות תגובה סבירה. אפשר לטעון אותו בעזרת llama.cpp, LM Studio, או ספריית llama-cpp-python לקוד פייתון. אם אין לכם לפחות כרטיס מסך עם 24 גיגה VRAM או מחשב מק עם מעבד סיליקון וזיכרון אחוד גבוה, עדיף להשתמש בשרת ענן.

ollama run hf.co/TheBloke/dolphin-2.7-mixtral-8x7b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקבצים, להפיץ אותם מחדש ולשלב אותם במוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בכל הפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗