GPT
T

Tifa-DeepsexV2-7b-MGRPO-GGUF-Q8

קוד פתוח

ValueFX9507apache-2.02025-02-15

  • transformers
  • gguf
  • incremental-pretraining
  • sft
  • reinforcement-learning

זהו כוונון של Qwen2.5-7B שמיועד למשחקי תפקידים וכתיבה עלילתית עם שרשרת חשיבה. הוא נועד לתת מענה עמוק בלי לסרב לבקשות של המשתמש.

  • 52.8 GBמשקל הקבצים
  • 1,581הורדות בחודש
  • 202לייקים

מה זה

הבסיס כאן הוא מודל שבעה מיליארד פרמטרים שאומן בשיטת חיזוק בשם MGRPO על נתוני ספרות ודיאלוגים. המטרה של המפתח היתה לפתור את הבעיה המרכזית במודלים פתוחים קטנים שמנסים לנהל שיחה ספרותית: שטחיות וסירובים תכופים. המודל מייצר שרשרת חשיבה עצמאית לפני שהוא פולט את התשובה, מה שמחזיק את הדמות לאורך זמן ומונע סטיות.

בכרטיס המודל מדווח שהגרסה הזו שוחררה בשלב מוקדם של שבעה אחוזים מהאימון המתוכנן מתוך כשלושת אלפים שעות H100. למרות זאת, המפתח טוען שהיא מציגה עקביות שעולה על מודלים של 14B ו־32B במבחן הדיאלוג. המודל תומך עקרונית בחלון הקשר של עד מיליון טוקנים, אם כי מדובר ביכולת של מודל הבסיס ולא בהכרח במשהו שנוסה עד קצהו כאן.

מתאים ל

  • משחקי תפקידים מבוססי טקסט

    הוא אומן להחזיק אישיות מורכבת וטקסט עשיר בלי לקטוע את השיחה בסירובי תוכן מיותרים.

  • כתיבת דיאלוגים לסיפורים

    שרשרת החשיבה שלו מאפשרת לו לנתח את הסיטואציה העלילתית לפני הפקת שורת המחץ של הדמות.

  • מחקר על אלגוריתם MGRPO

    הורדה לצורך בדיקת יעילות האימון בשלבים מוקדמים בהשוואה למודלים פתוחים אחרים בגודל 7B.

איפה זה נופל

המודל הזה לא מתאים לשום דבר שקשור למתמטיקה, כתיבת קוד או שאלות שדורשות דיוק עובדתי מוחלט. הכרטיס מציין בפירוש בעיות של הזיות ונטייה לתשובות דרמטיות מדי עקב תהליך ה־RL. מעבר לזה, קיימת בעיית אינטגרציה קריטית: חובה לנקות את תגיות החשיבה מתוך היסטוריית השיחה שנשלחת חזרה למודל, אחרת הוא מפסיק לענות בצורה הגיונית, ורוב הממשקים הקיימים לא עושים את זה לבד. תמיכת השפה היא בסינית ובאנגלית בלבד, כך שעברית לא באה בחשבון כאן.

שאלות
נפוצות

למה המודל מפסיק לענות לי אחרי שתיים או שלוש הודעות בצ'אט?

הוא מייצר תגיות חשיבה בתחילת כל תשובה. אם הממשק שלכם שולח את התגיות האלה בחזרה בהיסטוריה, המודל מתבלבל. צריך לנקות ידנית את התוכן שבין התגיות לפני ששולחים את ההיסטוריה הלאה.

האם כדאי להוריד גרסת כימות נמוכה יותר כדי לחסוך זיכרון?

לא. המפתח מציין במפורש שגרסת Q4 סובלת מירידה חדה באיכות הפלט וממליץ להישאר ברמת Q8 ומעלה כדי לקבל את היכולות של המודל.

איך מריצים

הגרסה הספציפית הזו שוקלת מעל 50 גיגה בייט במאגר שכולל קבצים שונים, כאשר קובץ ה־Q8 הבודד מיועד להרצה בספריות תואמות GGUF כמו llama.cpp. מודל 7B בכימות של 8 ביט דורש כרטיס מסך עם לפחות עשרה עד שנים עשר גיגה זיכרון כדי להחזיק את המשקלים ואת זיכרון ההקשר בסיסי. המפתח עצמו ממליץ במפורש לא לרדת לגרסת Q4 בגלל ירידה ניכרת באיכות.

אם אין לכם חומרה ייעודית עם זיכרון וידאו מספק, עדיף לבדוק את הדמו ברשת שמספקת החברה הסינית שליוותה את הפרויקט, או להשתמש במודל ענן גנרי. להרים את זה מקומית שווה רק למי שחייב שליטה מלאה בטקסט ובלי צנזורה חיצונית.

ollama run hf.co/ValueFX9507/Tifa-DeepsexV2-7b-MGRPO-GGUF-Q8:Q8

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים. עם זאת, היוצר מציין שהאימון כלל נתוני ספרות מוגנים בזכויות יוצרים ונתונים של Tifa שמחייבים הסכמה לתנאי שימוש נפרדים של חברת leftnorth, מה שיוצר סיכון משפטי למי שמתכנן להכניס אותו למוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗