GPT
D

dolphin-2_6-phi-2-GGUF

קוד פתוח

TheBlokeother2023-12-24

  • transformers
  • gguf
  • phi-msft
  • en
  • conversational

גרסה מכווצת בפורמט GGUF של מודל קטן ללא מנגנוני סינון ובלי חסימות תוכניות. הוא עונה על כל בקשה ישירות ומיועד למי שצריך להריץ מודל שיחה זריז על חומרה מקומית פשוטה.

  • 20.2 GBמשקל הקבצים
  • 5,369הורדות בחודש
  • 76לייקים

מה זה

הפרויקט הזה מבוסס על Phi 2 של מיקרוסופט שעבר כוונון ייעודי על ידי Cognitive Computations, ולאחר מכן הוסב למשקלי GGUF. העבודה התמקדה בהסרת חסמי התוכן הרגילים כדי לייצר מודל שנענה לפקודות בלי להטיף מוסר או לסרב. גרסה 2.6 כוללת תיקון של הגדרות האימון המקוריות, החזרה של נתוני אמפתיה מסוג samantha, ושילוב של מאגר השיחות Capybara במקום סטים ישנים יותר.

המשקלים ארוזים לשימוש ישיר במנועים מבוססי מעבד או מאיצים גרפיים קטנים. מדובר במודל שמכוון לספק שיחה שוטפת וגמישה במעטפת גודל מזערית, אבל הוא מגיע ללא בדיקות ביצועים רשמיות בכרטיס המודל. אין כאן נתוני השוואה מסודרים, כך שאיכות הפלט בפועל נשענת רק על השינויים במאגרי ההדרכה.

מתאים ל

  • עוזר מקומי למחשב נייד

    דורש פחות מחמישה ג'יגהבייט זיכרון עבודה ומגיב מהר על מעבדים ביתיים רגילים ללא תלות ברשת.

  • מחקר על מודלים ללא סינון

    מספק תגובות ישירות לפקודות שנויות במחלוקת בלי חסימות מערכתיות מובנות של היצרן.

  • ניתוח טקסטים באנגלית באופליין

    מתאים לסביבות עבודה מבודדות שבהן אסור להוציא מידע אל שירותי ענן חיצוניים.

איפה זה נופל

המודל מוגדר כלא מצונזר באופן מוצהר ומפתחיו מסירים אחריות מתוצריו. הוא ייענה לבקשות שכוללות תוכן לא אתי, פוגעני או מסוכן בלי להתריע, מה שמחייב אתכם לבנות שכבת הגנה וסינון משלכם אם המערכת פונה למשתמשי קצה. מעבר לכך, המודל אומן בשפה האנגלית בלבד, וכרטיס המודל מציין דרישה לשימוש בפרמטר trust_remote_code בקוד המקור.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל הוכשר בשפה האנגלית בלבד לפי נתוני המאגר. הוא לא מיועד לעבודה בעברית ולא ייתן תוצאות עקביות או שימושיות בשפה הזו.

אפשר לשלב אותו באפליקציה מסחרית לעסק?

לא. מודל הבסיס כפוף לתנאי הרישיון של מיקרוסופט למטרות מחקר בלבד, והוא אוסר שימוש מסחרי.

איזה קובץ מהרשימה כדאי להוריד?

מומלץ להוריד קובץ אחד בלבד לפי כמות הזיכרון הפנויה. גרסת Q4_K_M נותנת את האיזון הטוב ביותר בין משקל של 1.79 ג'יגהבייט לדיוק התוצאה.

איך מריצים

אין צורך להוריד את כל 20.2 הג'יגהבייט מהמאגר, אלא בוחרים קובץ בודד. להרצה שקולה ומאוזנת מתאים הקובץ dolphin-2_6-phi-2.Q4_K_M.gguf ששוקל 1.79 ג'יגהבייט ודורש בערך 4.29 ג'יגהבייט של זיכרון עבודה ללא שימוש במאיץ גרפי. מי שרוצה דיוק מרבי בלי חיתוך משמעותי יבחר בגרסת Q5_K_M שדורשת 4.57 ג'יגהבייט זיכרון עבודה.

מריצים אותו דרך כלים כמו llama.cpp, LM Studio, או ספריית llama-cpp-python בקוד פייתון. המודל בנוי לתבנית שיחה מסוג ChatML ומחייב מעבר על מבנה תגיות פתיחה וסגירה מדויק. אם אתם צריכים זמני תגובה גבוהים תחת עומס של עשרות משתמשים במקביל או הקשרים ארוכים במיוחד, החומרה המקומית תתקשה ועדיף לפנות למודל גדול יותר דרך שירות ענן.

ollama run hf.co/TheBloke/dolphin-2_6-phi-2-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ונשען על microsoft-research-license שהוצמד למודל הבסיס של מיקרוסופט. הרישיון הזה אוסר שימוש מסחרי מכל סוג. המשמעות היא שאי אפשר לשלב אותו במוצרים שנמכרים ללקוחות או בשירותים מניבי הכנסה, והוא מותר רק לניסויים ומחקר עצמאי.

הרישיון המלא בעמוד המודל ↗