GPT
D

dolphin-2.1-mistral-7B-GGUF

קוד פתוח

TheBlokeapache-2.02023-10-11

  • transformers
  • gguf
  • mistral
  • en

גרסת GGUF מכווצת למודל 7B של אריק הרטפורד שמבוסס על מיסטרל. הוא מיועד למי שמחפש מודל מקומי צייתן לחלוטין ללא מנגנוני סינון והטיה מובנים.

  • 51.2 GBמשקל הקבצים
  • 5,016הורדות בחודש
  • 109לייקים

מה זה

מדובר בהמרה של דולפין 2.1 לקובצי GGUF שמריצים על מעבד רגיל או מאיץ גרפי דרך llama.cpp. הבסיס הוא מיסטרל 7B שעבר כוונון על דאטה-סט של דולפין, יישום קוד פתוח של אורקה מבית מיקרוסופט, יחד עם נתוני אירובורוס להגברת היצירתיות. האימון המקורי לקח 48 שעות על ארבעה כרטיסי A100 לאורך ארבעה מחזורים.

ההבדל העיקרי מול מודלים אחרים בגודל הזה הוא הסרת היישור. המאמן ניקה את נתוני האימון מסינונים והטיות כדי ליצור מודל שמציית להוראות המשתמש בלי לסרב או להטיף מוסר. הפורמט דורש עבודה בתבנית ChatML כדי לתפקד כראוי.

מתאים ל

  • עוזר מקומי ללא סירובים

    צייתנות מוחלטת לפקודות משתמש במחשב אישי ללא צנזורה על נושאים רגישים.

  • ניסויי פרומפטים ב־ChatML

    בדיקת תרחישי שיחה מורכבים במבנה תגיות מוגדר ישירות דרך llama.cpp.

  • אינטגרציה בספריות פייתון

    הרצה מקומית מהירה וקלת משקל דרך ctransformers או עטיפות LangChain.

איפה זה נופל

המודל מוגדר רשמית כלא מסונן. הוא יענה על כל בקשה, כולל בקשות שאינן אתיות, ולא מסרב לפקודות בעייתיות. יוצר המודל מבהיר שחובה להוסיף שכבת סינון משלכם לפני שמציגים אותו למשתמשי קצה במוצר פעיל. בנוסף, נתוני המודל מוגדרים לאנגלית בלבד, כך שלא כדאי לבנות עליו לפעולות מורכבות בעברית. שילוב הקבצים בגרסאות הקיצוניות כמו Q2_K מאבד יותר מדי מידע מהמשקלים המקוריים.

שאלות
נפוצות

האם המודל יסרב לענות על שאלות לא חוקיות או פוגעניות?

לא. הדאטה-סט נוקה בכוונה מכל מנגנון יישור והטיה, ולכן הוא ייענה לכל הוראה. אם אתם חושפים אותו למשתמשים חיצוניים, אתם צריכים לבנות מנגנון חסימה משלכם מסביב.

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

לרוב השימושים עדיף לקחת את dolphin-2.1-mistral-7b.Q4_K_M.gguf. הוא נותן את האיזון הטוב ביותר בין שמירה על יכולות המקור לבין צריכת זיכרון של כ־6.9 ג'יגה-בייט.

האם אפשר להריץ את הקבצים האלה בלי מעבד גרפי של אנבידיה?

כן. קובצי GGUF מיועדים לעבודה ישירה על מעבד רגיל של המחשב עם זיכרון RAM. יש תמיכה גם בהאצה דרך Metal במחשבי מק או כרטיסי מסך אחרים אם רוצים ביצועים טובים יותר.

איך מריצים

לא צריך להוריד את כל המאגר ששוקל 51.2 ג'יגה-בייט, אלא רק קובץ בודד שמתאים לחומרה שלכם. הגרסה המאוזנת והמומלצת לרוב האנשים היא Q4_K_M, ששוקלת 4.37 ג'יגה-בייט ודורשת 6.87 ג'יגה-בייט זיכרון כדי לרוץ על המעבד בלבד. אם יש לכם מאיץ גרפי, אפשר להעביר שכבות לזיכרון הווידאו עם הדגל ngl כדי לקבל תגובה מהירה בהרבה.

אם יש לכם פחות משישה ג'יגה-בייט זיכרון פנוי, יש גרסאות של 2 או 3 ביט, אבל הן סובלות מירידה מורגשת באיכות הפלט. כשיש לכם מחשב נייד חלש בלי כרטיס ייעודי ואתם צריכים רק בדיקה מהירה, קריאה לשרת מרוחק תהיה פשוטה ומהירה יותר מהרצה מקומית של קובצי 5 ביט ומעלה.

ollama run hf.co/TheBloke/dolphin-2.1-mistral-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי וחופשי בלי תשלום תמלוגים, לצד שינוי והפצה של הקבצים. אתם יכולים לשלב אותו במוצר מסחרי, אבל היוצר מבהיר שהאחריות המלאה על התוכן שהמודל מייצר חלה עליכם בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗