GPT
L

laser-dolphin-mixtral-2x7b-dpo-GGUF

קוד פתוח

TheBlokeapache-2.02024-01-15

  • transformers
  • gguf
  • mixtral

שילוב של שני מודלי 7B במבנה MoE מוקטן, שעבר סינון רעשים ואימון ללא מעצורים. מתאים למי שרוצה ביצועים שעוקפים מודל 7B רגיל בלי להחזיק מפלצת חומרה.

  • 63.6 GBמשקל הקבצים
  • 2,039הורדות בחודש
  • 50לייקים

מה זה

הפרויקט הזה לוקח שני מודלים מבוססי מיסטרל, את OpenHermes 2.5 ואת dolphin 2.6 שעבר טיפול בלייזר להסרת שכבות רועשות, ומחבר אותם למבנה של Mixture of Experts עם שני מומחים בלבד. הרעיון הוא לקבל כושר ניתוח עמוק יותר משל מודל 7B בודד, בלי לשלם את מחיר הזיכרון של שמונה מומחים כמו במיקסטרל המקורי.

במבחני hellaswag המודל מוציא דיוק של 0.8354 בדיוק מלא ו־0.8270 בכימות של 4 ביט. המספרים האלה מראים שהחיבור עובד, המודל המכומת שומר כמעט על כל היכולת שלו ומציג הבנה טובה של שפה והקשר, מעבר למה ש־7B בודד מסוגל לתת ברמת הדיוק הזו.

מתאים ל

  • סוכן שיחה פנימי וחופשי

    עונה על כל הנחיה ישירות וללא סינוורים, מצוין לבדיקות פנימיות שלא דורשות פילטרים.

  • מיצוי מידע במחשב אישי

    רץ מצוין ב־4 ביט על מחשב פיתוח עם כרטיס מסך בסיסי של 10 עד 12 גיגה בייט זיכרון.

  • ניתוח טקסט מורכב במקום 7B

    מבנה ה־MoE נותן לו יתרון הבנה מובהק על פני מודלים רגילים באותו סדר גודל פיזי.

איפה זה נופל

הבסיס כאן הוא דולפין, שמוגדר כחסר צנזורה לחלוטין, מה שאומר שאין פה מנגנוני הגנה מובנים והוא יענה על כל הנחיה בלי לסנן. המודל עלול לפלוט תוכן פוגעני או שגוי בלי שום התראה. בנוסף, מדובר בהכלאה ניסיונית של שני מומחים, כך שאין שום הבטחה לעקביות, ובדיקות בעברית לא קיימות בכרטיס המודל וחייבות להיעשות ידנית לפני שחושבים לחבר אותו למשהו רציני.

שאלות
נפוצות

איזה קובץ להוריד מתוך כל הקבצים?

קחו את laser-dolphin-mixtral-2x7b-dpo.Q4_K_M.gguf. הוא נותן את היחס הטוב ביותר בין איכות התשובות לדרישות זיכרון, עם קובץ של פחות מ־8 גיגה בייט.

האם המודל מתאים למוצר שפונה ללקוחות קצה?

לא מומלץ בלי מעטפת סינון משלכם. סדרת דולפין מאומנת לציית לכל הוראה ללא בלמים, ולכן חובה להוסיף שכבת הגנה חיצונית לפני שמשחררים אותו למשתמשים חיצוניים.

איך מריצים

כדי להריץ אותו מקומית עם llama.cpp או ספריות תואמות, הגרסה המומלצת לרוב השימושים היא Q4_K_M ששוקלת 7.78 גיגה בייט ודורשת בערך 10.28 גיגה זיכרון עבודה ללא כרטיס מסך, או כ־9 גיגה בייט VRAM אם מעלים הכל לכרטיס. אם יש לכם כרטיס ביתי פשוט של 8 גיגה, תצטרכו לרדת לגרסת Q3_K_M של 6.21 גיגה בייט כדי למנוע גלישה לזיכרון המערכת.

גרסאות ה־8 ביט מגיעות לקובץ של כמעט 14 גיגה בייט ודורשות מעל 16 גיגה זיכרון, ואין בהן צורך אמיתי לאור הביצועים הטובים של 4 ביט. אם אין לכם מעבד גרפי ייעודי של לפחות 12 גיגה לפעולה חלקה, עדיף להשתמש במודל גדול יותר דרך שירות ענן חיצוני מאשר להתפשר על איטיות מקומית.

ollama run hf.co/TheBloke/laser-dolphin-mixtral-2x7b-dpo-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache 2.0 מלא. אתם יכולים להשתמש בו באופן חופשי לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים של היוצרים המקוריים וציון הרישיון בכל הפצה של הקוד או הקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗