GPT
D

deepsex-34b-GGUF

קוד פתוח

TheBlokemit2023-12-06

  • transformers
  • gguf
  • yi
  • roleplay
  • not-for-all-audiences

גרסת קוונטיזציה של מודל המבוסס על Yi-34B ומיועד למשחקי תפקידים וכתיבה לקהל בוגר ללא צנזורה. מי שמחפש יצירת סיפורים אינטראקטיביים עם תכני NSFW מקבל כאן מענה מקומי.

  • 243 GBמשקל הקבצים
  • 2,605הורדות בחודש
  • 134לייקים

מה זה

המודל הוא כוונון עדין של Yi-34B-base שעבר אימון מקדים נוסף על כארבעה גיגה־בייט של ספרי רומנים קלים לצד טקסטים למבוגרים. לאחר מכן, היוצר zhouliang ביצע כוונון על כשלושים אלף שיחות שעברו סינון על ידי המודל goliath-120b מתוך המאגרים limarp ו־pippa. הפורמט שבו המודל עובד הוא Alpaca סטנדרטי.

המשקל של 34 מיליארד פרמטרים מעניק לו יתרון כושר ביטוי ועקביות עלילתית לעומת מודלי 7B או 13B נפוצים. התוצאה מכוונת לסגנון עשיר של משחקי תפקידים עם נטייה לשלב אלמנטים רגשיים ורומנטיים לצד כתיבה מפורשת.

מתאים ל

  • משחקי תפקידים בוגרים

    אינטראקציה מבוססת דמויות ביישומי צ'אט מקומיים ללא סינוני בטיחות או צנזורה על תוכן מיני.

  • כתיבת ספרות בדיונית

    יצירת דיאלוגים ופסקאות המשך לרומנים קלים באנגלית שדורשים סגנון רומנטי לצד תכנים בוגרים.

  • מחקר על מודלי שיחה ייעודיים

    בחינת יכולות הסינון של נתוני אימון מבוססי דירוג ממודלים גדולים כמו goliath-120b על גבי 34B.

איפה זה נופל

האימון התמקד כולו באנגלית ובספרות קלה, כך שהוא אינו מתאים לשפות אחרות ועברית בפרט תפיק פלטים משובשים או חסרי הקשר. הדחיסות הנמוכות מתחת ל־4 ביט גורמות לאובדן איכות מורגש ולחזרתיות.

בנוסף, הכרטיס אינו כולל שום מבחני ביצועים כמותיים, בדיקות הזיות או מדידות קוד ופתרון בעיות. הכוונון נועד אך ורק לטקסט בדיוני ושיחות, ולכן לא מומלץ לבנות עליו למשימות עסקיות, סיכום מידע, עבודה מבוססת עובדות או יצירת קוד תוכנה.

שאלות
נפוצות

איזה קובץ כדאי להוריד למחשב עם כרטיס מסך של 24GB?

הקובץ deepsex-34b.Q4_K_M.gguf בגודל של כ־20.66 גיגה־בייט ייכנס במלואו לזיכרון של כרטיס 24GB יחד עם הקשר של 4096 טוקנים. אם יש לכם גם זיכרון מערכת פנוי ואתם מוכנים לחלוקת שכבות, תוכלו לנסות את Q5_K_M לאיכות מעט טובה יותר.

האם המודל מתאים לפיתוח בוטים בעברית?

לא. נתוני האימון המקדים והכוונון העדין מבוססים על אנגלית בלבד. כל ניסיון לנהל איתו שיחה בעברית יפיק תחביר שבור, תרגום עילג ואיבוד מהיר של ההקשר.

למה התשובות חוזרות על עצמן בזמן שיחה?

פורמט ההנחיה המומלץ הוא Alpaca, ומומלץ להגדיר repeat_penalty של לפחות 1.1 כפי שמופיע בדוגמת ההרצה. אם המודל עדיין ממחזר משפטים, שימוש ברמות קוונטיזציה נמוכות כמו Q2_K או Q3_K עלול להיות הגורם לכך.

איך מריצים

הגרסאות בפורמט GGUF מתחילות מקובץ Q2_K בגודל 14.56 גיגה־בייט הדורש כ־17.06 גיגה זיכרון, ומגיעות עד Q8_0 ששוקל 36.54 גיגה־בייט ודורש מעל 39 גיגה זיכרון. לרוב המשתמשים מומלץ לבחור בגרסת Q4_K_M ששוקלת 20.66 גיגה־בייט או Q5_K_M ששוקלת 24.32 גיגה־בייט. אלו מציעות איזון איכותי ללא פגיעה חריפה בביצועים.

כדי להריץ אותו עם פריקה מלאה למעבד גרפי תצטרכו כרטיס עם 24 גיגה זיכרון וידאו עבור רמות הדחיסה הבינוניות. אם החומרה שלכם כוללת מעבד בלבד או כרטיס מסך ביתי קטן, תרגישו ירידה ניכרת בקצב יצירת המילים. אפשר להשתמש בממשקים מקומיים פשוטים כמו text-generation-webui, LM Studio, KoboldCpp או ישירות דרך ספריית llama-cpp-python.

ollama run hf.co/TheBloke/deepsex-34b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשום במאגר הוא MIT, שמתיר שימוש מסחרי ואישי חופשי, שינוי והפצה ללא תשלום תמלוגים, בכפוף להשארת הודעת זכויות היוצרים. יחד עם זאת, כיוון שהבסיס הוא Yi-34B, מפתחים שמפיצים מוצר צריכים לוודא שאין סתירה מול תנאי השימוש המקוריים של מודל הבסיס.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗