GPT
D

dolphin-2.6-mistral-7B-GGUF

קוד פתוח

TheBlokeapache-2.02023-12-28

  • transformers
  • gguf
  • mistral
  • en

גרסה מכווצת בפורמט GGUF של דולפין 2.6, שמבוסס על מיסטרל 7B. המטרה כאן היא מודל שיחה וכתיבת קוד שמציית להוראות בלי סינונים מובנים.

  • 51.2 GBמשקל הקבצים
  • 7,404הורדות בחודש
  • 92לייקים

מה זה

המאגר הזה מכיל המרות של דולפין 2.6, מודל של Cognitive Computations שעבר אימון על בסיס מיסטרל 7B בעזרת qLoRA במשך יומיים על ארבעה מעבדי A100. הדגש המרכזי באימון היה כתיבת קוד, לצד הוספת דאטה של שיחות אמפתיות והחלפת מקורות נתונים ישנים בערכות נתונים כמו Capybara. הפורמט לשיחה הוא ChatML, כאשר המודל מוגדר לשימוש עם הקשר בסיסי של 16K טוקנים.

ההבדל העיקרי מול מודלים רגילים באותו גודל הוא הסרת מנגנוני הסינון וההטיה. היוצר ניקה את הנתונים כדי שהמודל לא יסרב לשאלות, מה שהופך אותו לצייתן במיוחד, אבל כזה שדורש ממך לנהל את הסיכונים בעצמך אם אתה חושף אותו למשתמשי קצה.

מתאים ל

  • עוזר מקומי לכתיבת קוד

    מתאים לסביבת פיתוח מקומית בלי תלות ברשת, בזכות אימון ייעודי על נתוני תכנות.

  • צ'אטבוט עצמאי ללא צנזורה

    מגיב ישירות לכל בקשה ומבצע פקודות מערכת מורכבות בלי סירובים מובנים.

  • סוכן בדיקות ואבטחה

    מסייע במחקר חולשות ובדיקות חדירות שבהן מודלים מסחריים רגילים נוטים לחסום את השאילתות.

איפה זה נופל

המודל מוגדר כלא מצונזר ולא עבר אימון מסוג DPO. זה אומר שהוא יענה לכל הוראה בלי שום גבולות מוסריים או חוקיים, ואם צריך כיוונון עדין של התשובות תצטרך לדחוף אותו לזה בהנחיות המערכת. אסור לחבר אותו למשתמשי קצה בלי לבנות שכבת בקרה נפרדת מסביבו. בנוסף, האימון מיועד לשפה האנגלית, וגרסאות הכיווץ הנמוכות כמו Q2_K או Q3 סובלות מירידה ניכרת באיכות הפלט.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

עבור רוב השימושים כדאי לקחת את dolphin-2.6-mistral-7b.Q4_K_M.gguf. הוא שוקל 4.37 ג'יגה, שומר על איזון בין משקל לאיכות, ודורש פחות מ־7 ג'יגה זיכרון עבודה אם מריצים אותו על המעבד ללא כרטיס מסך.

האם המודל תומך בעברית?

האימון והנתונים בכרטיס המודל מוגדרים לאנגלית בלבד. הוא יכול לייצר מילים בודדות בעברית בזכות משקלי הבסיס של מיסטרל, אבל הוא לא מיועד לשיחה או לכתיבה שוטפת בעברית ואי אפשר להסתמך עליו בזה.

האם המודל יסרב לבקשות לא חוקיות או פוגעניות?

לא. המודל עבר סינון מכוון שמחק את מנגנוני הבטיחות וההטיות, כך שהוא עונה על כל פקודה שתקבל. אם אתה בונה איתו מוצר שפונה לאנשים, האחריות עליך להקים מערכת חיצונית שתסנן את הקלט והפלט.

איך מריצים

אין צורך להוריד את כל המאגר ששוקל מעל 51 ג'יגה. בוחרים קובץ בודד לפי החומרה שיש לך, כשההמלצה הישירה היא גרסת Q4_K_M ששוקלת 4.37 ג'יגה ודורשת כמעט 7 ג'יגה זיכרון עבודה בהרצה על המעבד בלבד. אם יש לך כרטיס מסך עם מספיק זיכרון וידאו, מעבירים אליו שכבות כדי לקבל קצב תגובה סביר, או עולים לגרסאות Q5_K_M שלוקחות קצת יותר מ־7.5 ג'יגה זיכרון.

ההרצה עצמה עובדת חלק דרך llama.cpp בפקודת שורה פשוטה, או דרך כלים עם ממשק מקומי כמו LM Studio, Text Generation WebUI או KoboldCpp. למפתחי פייתון עדיף להשתמש בספריית llama-cpp-python ולא ב־ctransformers הישנה שלא עודכנה.

ollama run hf.co/TheBloke/dolphin-2.6-mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים, כל עוד שומרים על תנאי הרישיון המקוריים ומתן הקרדיט הנדרש. כיוון שהמודל לא מסנן תכנים, היוצר מבהיר שהאחריות המשפטית על הפלטים חלה כולה על מי שמריץ ומפיץ את השירות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗