GPT
D

dolphin-2.6-mistral-7B-dpo-laser-GGUF

קוד פתוח

TheBlokeapache-2.02024-01-09

  • transformers
  • gguf
  • mistral
  • en

גרסת קוונטיזציה של מודל פתוח מבוסס מיסטרל, שעבר הסרת סינונים ומנגנון להפחתת רעשים. הוא מיועד למי שצריך ציות מוחלט להוראות בלי חסימות בטיחות מובנות.

  • 51.2 GBמשקל הקבצים
  • 3,480הורדות בחודש
  • 44לייקים

מה זה

מדובר בעיבוד GGUF למודל של Cognitive Computations, שנבנה על גבי Mistral 7B עם חלון הקשר של 16k. המפתחים שילבו כאן אימון DPO יחד עם טכניקת LASER, שמשתמשת בפירוק SVD כדי להפחית רעש בשכבות המודל ולחדד את יכולות ההסקה שלו. לפי הדיווח שלהם, השילוב הזה הביא לציונים גבוהים יותר מהגרסאות הקודמות של דולפין, ואמור לייצר תשובות יציבות ומדויקות יותר תחת אותה ארכיטקטורה.

המאפיין המרכזי כאן הוא היעדר צנזורה מכוון. המפתחים ניקו מהדאטהסט שכבות יישור וערכי בטיחות מקובלים, כך שהמודל לא מתווכח, לא מטיף מוסר ועונה ישירות על כל בקשה. הפורמט של TheBloke מאפשר לקחת את היכולת הזו ולהריץ אותה מקומית בקבצים מכווצים, במקום להחזיק משקלי עבודה מלאים וכבדים שדורשים כרטיסי מסך יקרים של שרתים.

מתאים ל

  • בוט שיחה חופשי מצנזורה

    מענה ישיר להוראות מורכבות בלי סירובים או הטפות מוסר שמופיעים במודלים מסחריים.

  • עוזר מקומי על חומרה ביתית

    הרצה שקטה בתוך תוכנות קיימות עם קובץ שדורש פחות משבעה גיגה זיכרון.

  • סימולציות ומשחקי תפקידים

    בניית דמויות שמגיבות באופן אמין לסיטואציות קיצוניות בלי חסימות תוכן אוטומטיות.

איפה זה נופל

היתרון של המודל הוא גם החולשה הכי מסוכנת שלו. הוא חסר סינונים לחלוטין, מה שאומר שהוא יבצע כל פקודה, כולל בקשות זדוניות, פוגעניות או לא חוקיות. מי שמתכנן להוציא אותו לשירות חיצוני חייב לבנות שכבת בדיקות וסינון משלו. בנוסף, נתוני הכרטיס מראים שהאימון מיועד לאנגלית בלבד, ואין שום התחייבות רשמית לגבי ביצועים בשפות אחרות או שימור עקביות במשימות מורכבות.

שאלות
נפוצות

האם המודל תומך בעברית?

השפה המוצהרת בכרטיס היא אנגלית בלבד. יכול להיות שהוא יפלוט משפטים פשוטים בעברית בגלל הבסיס של מיסטרל, אבל בלי אימון מותאם הוא יתקשה מאוד בניסוח ודיוק.

כמה זיכרון אני צריך במחשב כדי לעבוד איתו חלק?

לגרסת Q4_K_M המומלצת תצטרכו כרטיס מסך עם לפחות שמונה גיגה זיכרון כדי להריץ את כל השכבות על המעבד הגרפי, או כשבעה גיגה RAM אם אתם מריצים על המעבד הרגיל.

אפשר לשלב אותו ישירות במוצר ללקוחות בלי סינון?

לא כדאי. המודל יציית לכל בקשה כולל יצירת תוכן אסור ומסוכן, ולכן אתם חייבים להקים שכבת הגנה משלכם לפני שמשתמשים ניגשים אליו.

איך מריצים

בשביל להריץ אותו מקומית מורידים קובץ בודד בהתאם לזיכרון הפנוי. הגרסה המאוזנת והמומלצת לרוב המשתמשים היא Q4_K_M, ששוקלת 4.37 גיגה ומבקשת בערך 6.87 גיגה זיכרון עבודה אם מריצים רק על המעבד, או נכנסת בקלות לכרטיס מסך ביתי עם 8 גיגה VRAM. אם המשאבים מוגבלים אפשר לרדת ל־Q3_K_M, אבל ב־Q2_K כבר יש אובדן איכות משמעותי.

טוענים את הקובץ ישירות בתוכנות כמו LM Studio, KoboldCpp או llama.cpp, עם תבנית ChatML שמגדירה את תפקידי המערכת, המשתמש והעוזר. אתם יכולים לדחוף שכבות לכרטיס המסך כדי להאיץ את קצב הפליטה. הרצה מקומית כזו מתאימה לפרטיות מוחלטת ולניסויים, אבל אם צריך לשרת משתמשים רבים במקביל, כנראה שעדיף לשלם על תשתית ענן ייעודית.

ollama run hf.co/TheBloke/dolphin-2.6-mistral-7B-dpo-laser-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמתיר שימוש חופשי ופתוח, כולל שימוש מסחרי מלא. אתם יכולים לשנות אותו, להטמיע אותו בתוך מוצר ולמכור גישה אליו, בתנאי שאתם מצרפים עותק של הרישיון המקורי ומציינים את זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗