GPT
D

dolphin-2.6-mixtral-8x7b-GGUF

קוד פתוח

TheBlokeapache-2.02023-12-22

  • transformers
  • gguf
  • mixtral
  • en
  • conversational

גרסת GGUF לאימון מחדש של Mixtral, ללא מנגנוני סינון ובלי יישור מוסרי. הוא יבצע כמעט כל פקודה שתיתנו לו, במיוחד סביב קוד, בלי להטיף מוסר או לסרב.

  • 225 GBמשקל הקבצים
  • 2,631הורדות בחודש
  • 49לייקים

מה זה

מדובר בהמרה של TheBloke למודל Dolphin 2.6, שנבנה במקור על גבי Mixtral 8x7B על ידי Cognitive Computations. האימון הספציפי הזה התמקד בהסרת שכבות הבטיחות הרגילות ובהוספת דאטה משמעותי של תכנות, לצד נתוני אמפתיה וסטים כמו Capybara. המודל אומן במשך שלושה ימים על ארבעה מאיצי A100 באמצעות qLoRA, תוך שימוש בתבנית שיחה של ChatML.

הבסיס המקורי מציע חלון הקשר של שלושים ושניים אלף טוקנים, אבל האימון הנוכחי בוצע על חלון של שישה עשר אלף בלבד. היתרון המרכזי כאן מול מודלים פתוחים אחרים בגודל הזה הוא הצייתנות המוחלטת, שכן היוצר סינן מהדאטה את כל ההטיות והמגבלות המלאכותיות, מה שהופך אותו למאוד ישיר במשימות טכניות מורכבות.

מתאים ל

  • כתיבת קוד ובדיקות

    הוא אומן על כמויות גדולות של קוד ומפיק פתרונות טכניים מורכבים בלי להיחסם על תוכן רגיש.

  • סביבות פיתוח מקומיות

    מתאים לשרת פנימי שלא תלוי ברשת חיצונית ומריץ פקודות ישירות דרך llama.cpp או LM Studio.

  • עוזר שיחה גמיש

    צייתן במיוחד ל־system prompt מפורט ומאפשר שליטה מלאה על אופי התשובות ללא סינוני מערכת.

איפה זה נופל

המודל מוגדר כלא מצונזר באופן מוחלט, וזה החיסרון הכי גדול שלו בכל הנוגע ליישום בעולם האמיתי. הוא לא עבר אימון DPO, מה שאומר שלפעמים צריך לדחוף אותו בכוח דרך ה־system prompt כדי שיעקוב אחרי הנחיות מדויקות ולא יסטה מהן. הוא יענה על כל שאלה, כולל שאלות לא חוקיות או מזיקות, ולכן אי אפשר לחבר אותו ישירות למשתמשי קצה בלי לבנות שכבת בדיקות וסינון עצמאית משלכם. בנוסף, חלון ההקשר באימון קוצר בחצי לעומת המודל המקורי, והוא מוגדר רשמית לאנגלית בלבד, כך שביצועים בעברית אינם מובטחים ולא נבדקו כאן.

שאלות
נפוצות

האם המודל מתאים למוצר שפונה ישירות ללקוחות?

לא מומלץ לחבר אותו ישירות ללקוחות בלי מעטפת הגנה. המודל אינו מצונזר ויענה ללא היסוס על שאלות לא אתיות, פוגעניות או בעייתיות, כך שאתם נושאים באחריות המלאה לפלט.

איזו גרסת קובץ כדאי להוריד מתוך הרשימה?

לרוב השימושים כדאי לבחור בגרסת Q4_K_M. היא מציעה יחס אופטימלי בין שמירה על יכולות המודל לנפח זיכרון של כעשרים ותשעה גיגה־בייט, בעוד גרסאות נמוכות יותר כמו Q2_K סובלות מירידה ניכרת באיכות.

איך מריצים

בשביל להריץ אותו מקומית צריך מפרט כבד. קובץ הריצה המומלץ והמאוזן, Q4_K_M, שוקל מעל עשרים ושישה גיגה־בייט ודורש קרוב לעשרים ותשעה גיגה־בייט זיכרון כדי לעבוד ללא פריקה לכרטיס מסך. אם אתם רוצים איכות מקסימלית בגרסאות כמו Q8_0, תצטרכו כבר מעל חמישים ושניים גיגה־בייט זיכרון פנוי. אפשר לפרוק שכבות לכרטיס מסך עם llama.cpp כדי להאיץ את הביצועים, אבל אם אין לכם כרטיס עם VRAM משמעותי, הריצה על מעבד בלבד תהיה אטית מאוד.

החבילה נתמכת ישירות בכלים מוכרים כמו LM Studio, llama-cpp-python או text-generation-webui. אם אין לכם תחנת עבודה ייעודית עם זיכרון מתאים, עדיף בהחלט לשכור שרת ענן לפי שעה או לצרוך מודל מרוחק דרך API במקום להשקיע בחומרה מקומית רק עבורו.

ollama run hf.co/TheBloke/dolphin-2.6-mixtral-8x7b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח בעמוד הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקבצים ללא תמלוגים, ומאפשר לשלב אותו במוצרים מסחריים כל עוד שומרים על הודעת זכויות היוצרים המקורית וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗