GPT
D

dolphin-2.2.1-mistral-7B-GGUF

קוד פתוח

TheBlokeapache-2.02023-10-30

  • transformers
  • gguf
  • mistral
  • en

גרסת GGUF של דולפין 2.2.1 על בסיס מיסטרל 7B, מכוונת לשיחות מרובות שלבים ועונה בלי פילטרים של תקינות פוליטית או סירוב מובנה.

  • 51.2 GBמשקל הקבצים
  • 8,119הורדות בחודש
  • 123לייקים

מה זה

המודל הזה הוא תוצר של כוונון עדין שיצר אריק הרטפורד על בסיס Mistral 7B, כשהבלוק ארז אותו בפורמט GGUF להרצה מקומית. האימון שילב נתונים ממיזם Orca של מיקרוסופט, סט הנתונים Airoboros ליצירתיות, וחלקים מ־Samantha ו־WizardLM כדי לתת לו אופי אנושי יותר ויכולת לנהל שיחות ארוכות. בגרסה 2.2.1 היוצר ניסה לתקן התאמת יתר שגרמה למודל הקודם להוסיף הסברי מחשבה גם כשלא התבקש.

ההבדל העיקרי מול מיסטרל המקורי או גרסאות שיחה רגילות הוא הסרת חסמי הבטיחות. היוצר ניקה מהדאטה את שכבות ההתאמה שגורמות למודלים לסרב לבקשות. הוא יענה על כמעט כל מה שתבקשו בלי להטיף מוסר, מה שהופך אותו לצייתן במיוחד אבל גם מסוכן לחשיפה ישירה מול משתמשי קצה.

מתאים ל

  • בוט שיחה אישי ולא מתחסד

    אימון המודל כלל נתוני שיחה ואמפתיה, והוא לא מסרב לענות או קוטע את השיחה בהטפות.

  • עבודה מקומית ללא אינטרנט

    גרסת Q4 דורשת פחות מ־7 גיגה זיכרון ומתאימה למחשבים אישיים ללא תלות בשרת חיצוני.

  • בדיקות חוסן ומחקר

    היעדר מנגנוני הבטיחות מאפשר לבדוק תרחישי קיצון ואינטראקציות שמודלים נעולים חוסמים מיד.

איפה זה נופל

היוצר מציין במפורש שהמודל הזה לא מצונזר. הוא יענה לבקשות לא אתיות, יספק תוכן בוטה וישתף פעולה עם הנחיות פוגעניות בלי להסס. מי שמתכנן לחשוף אותו למשתמשי קצה חייב לבנות שכבת סינון וניטור משלו, כי אין כאן שום מעקה בטיחות מובנה.

בנוסף, הכרטיס מציין אנגלית בלבד. בעברית הוא כנראה יקרטע ויפלוט שגיאות ניסוח או הזיות, אז אל תבנו עליו לעיבוד שפה מקומית בלי לבדוק אותו ביסודיות.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

עבור רוב השימושים כדאי לבחור בקובץ dolphin-2.2.1-mistral-7b.Q4_K_M.gguf. הוא שוקל 4.37 גיגה ומציע שילוב אופטימלי בין מהירות, ניצול זיכרון ודיוק. אם יש לכם זיכרון פנוי בכרטיס המסך, אפשר לעלות ל־Q5_K_M.

באיזה מבנה הנחיה צריך להשתמש כדי שהמודל יעבוד טוב?

המודל אומן לפי הפורמט של ChatML. יש לספק את ההנחיות עם התגיות המתאימות לתפקידי מערכת, משתמש ועוזר. שימוש בפורמט טקסט חופשי אחר יפגע בדיוק התשובות וביכולת ניהול השיחה.

איך מריצים

בשביל להריץ אותו לא צריך מפלצת מחשוב. קובץ ה־Q4_K_M שוקל 4.37 גיגה ומבקש כ־6.87 גיגה של זיכרון עבודה בהרצה על המעבד, כך שהוא רץ חלק כמעט על כל מחשב פיתוח מודרני. אם יש לכם כרטיס מסך עם לפחות 6 גיגה VRAM, אפשר לזרוק את כל השכבות לכרטיס ולקבל קצב יצירה מהיר בעזרת llama.cpp, LM Studio או ספריית llama-cpp-python.

מי שאין לו כוח להתעסק בניהול משאבים, דרייברים או שרת פנימי יכול לקרוא ל־API חיצוני של מודלים פתוחים, אבל הפואנטה של קובצי GGUF היא פרטיות מוחלטת ועבודה במצב לא מקוון. המאגר מכיל גרסאות מ־Q2_K הקטנה ועד Q8_0, כשההמלצה היא להישאר באזור ה־Q4 או Q5 לאיזון נכון בין גודל לאיכות פלט.

ollama run hf.co/TheBloke/dolphin-2.2.1-mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש בתוך מוצרים. אין חובה לפתוח את הקוד שלכם, אבל אתם נושאים באחריות מלאה לכל תוכן שהמודל פולט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗