GPT
D

dolphin-2.9.1-mixtral-1x22b

קוד פתוח

dphnapache-2.02024-05-22

  • transformers
  • safetensors
  • mixtral
  • text-generation
  • generated_from_trainer

גרסה מכווצת ונטולת צנזורה של ענק ה־8x22B, שממזגת שמונה מומחים למודל צפוף של 22 מיליארד פרמטרים. היא תענה על כל בקשה בלי לסרב או להטיף מוסר.

  • 22Bפרמטרים
  • 65,536טוקנים בהקשר
  • 41.4 GBמשקל הקבצים
  • 8,827הורדות בחודש

מה זה

הצוות של קוגניטיב קומפיוטיישנס לקח את המודל המקורי Mixtral-8x22B וביצע בו ניתוח לא שגרתי. במקום לשמור על ארכיטקטורת תערובת מומחים כבדה שדורשת משאבי ענק, הם מיזגו את שמונת המומחים יחד באמצעות שיטת SLERP ויצרו מומחה יחיד. המבנה שנוצר שומר על התאימות המקורית של מיקסטרל כדי לא לאבד ביצועים, אך דורש משאבים של מודל צפוף רגיל. המודל אומן מחדש על כל השכבות שלו במשך 27 שעות על שרת של שמונה כרטיסי H100, תוך שימוש ברצפים באורך של 16 אלף טוקנים.

התוצר מחזיק ביכולות שיחה, כתיבת קוד, ופונקציות סוכניות בסיסיות כמו הפעלת כלים חיצוניים. ההבדל המשמעותי ביותר מול מודלים רגילים בתעשייה הוא הסרת ה־Alignment. הדאטה עבר סינון מכוון כדי לנקות חסימות והטיות, כך שהתוצאה נענית לכל פקודה ישירות. מי שמחפש מודל ממושמע שלא מתחמק מתשובות לשאלות רגישות ימצא כאן מענה, אבל הוויתור על מנגנוני הבטיחות דורש תשומת לב מיוחדת.

מתאים ל

  • עוזר פיתוח וכתיבת קוד

    הוא כולל יכולות קידוד נרחבות ועונה על שאלות תכנות מורכבות בלי לחסום פקודות מערכת.

  • סוכן מבוסס פונקציות

    התמיכה המובנית בקריאת פונקציות מתאימה לחיבור תהליכי עבודה אוטומטיים מול ממשקי רשת.

  • בדיקות אבטחת מידע

    היעדר הצנזורה מאפשר לבדוק תרחישי תקיפה וניסויי חדירה בלי שהמודל יסרב לייצר את הטקסט.

איפה זה נופל

היוצרים מצהירים בגלוי שהמודל לא מצונזר כלל. הוא ימלא פקודות גם אם הן פוגעניות, זדוניות או לא אתיות, בלי שום מנגנון פנימי שיעצור אותו. אם אתם בונים מוצר שפונה למשתמשי קצה, אתם חייבים לבנות שכבת הגנה וסינון משלכם לפני שהפלט יוצא החוצה.

בנוסף, תהליך המיזוג של שמונה מומחים לאחד הוא ניסיוני מטבעו ועלול לפגוע ביציבות התשובות בחלק מהמשימות. המודל הוגדר רשמית רק עבור השפה האנגלית, והוא אומן על מידע שנוצר בין היתר על ידי GPT-4, כך שהמגבלות של דאטה סינתטי חלות גם עליו.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. סביר שהוא יבין מילים בודדות בעברית בזכות משקלי הבסיס, אבל הפלט בעברית לא יהיה איכותי ולא מומלץ להסתמך עליו למשימות ייצור.

מה ההבדל בינו לבין Mixtral 8x22B המקורי?

המקור מפעיל שמונה מומחים שונים ודורש זיכרון וידאו עצום להרצה מלאה. כאן שמונת המומחים מוזגו מתמטית למומחה אחד, מה שמקטין דרמטית את דרישות החומרה אך עלול לגרוע מאיכות התשובות בחלק מהתרחישים.

איך מריצים

המשקל הגולמי מגיע ל־41.4 גיגה בייט בפורמט bfloat16. כדי להריץ אותו כמו שצריך בלי כימות, תצטרכו לפחות כרטיס A100 או שני כרטיסי 24GB שמחוברים יחד, וגם אז כדאי להשתמש ב־vLLM או TGI כדי לנהל את הזיכרון ביעילות.

אם אין לכם חומרה כזאת בענן מקומי או במשרד, עדיף להמתין לגרסאות מקוונטטות של GGUF לשימוש במחשב אישי, או לשלוח קריאות לספק חיצוני שמארח את המודל ב־API וגובה לפי שימוש בפועל.

from transformers import pipeline

pipe = pipeline("text-generation", model="dphn/dolphin-2.9.1-mixtral-1x22b")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים של היוצרים המקוריים והצהרת שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗