GPT
Q

Qwen3-4B-RPG-Roleplay-V2

קוד פתוח

Chun121mit2025-07-07

  • transformers
  • safetensors
  • gguf
  • qwen3
  • roleplay

התאמה ייעודית למשחקי תפקידים שרצה מקומית על חומרה צנועה. הוא מחזיק דמות בעזרת מנגנון חשיבה פנימי שמתעדכן לפני כל תשובה.

  • 16.8 GBמשקל הקבצים
  • 18,278הורדות בחודש
  • 71לייקים

מה זה

מדובר באימון של מודל בסיס 4B באמצעות שיטת GRPO, שמחזקת תגובות לפי פרמטרים של עקביות דמות ומבנה במקום חיזוי טקסט פשוט בלבד. הוא אומן על מאגר של קרוב לעשרת אלפים שיחות סינתטיות שנוצרו על ידי Sonnet 3.5, במטרה לשמור על אופי מוגדר היטב בפורמט כרטיסי דמות.

בניגוד למודלים כלליים בסדר הגודל הזה שנוטים לצאת מהתפקיד אחרי שתיים שלוש הודעות, כאן יש חלוקה מובנית לתגיות thinking ו־RESPONSE. הוא מייצר ניתוח פנימי לפני שהוא עונה למשתמש, מה שעוזר לו להישאר צמוד להנחיות המקוריות ולא לאבד כיוון במהירות.

מתאים ל

  • דמויות NPC מקומיות

    משחקים עצמאיים שצריכים דמויות מדברות על גבי החומרה של השחקן, ללא עלויות שרת שוטפות.

  • סימולציות שיחה קצרות

    תרגול תרחישים ממוקדים שבהם הדמות צריכה להיצמד להנחיות ספציפיות בטווח של כמה חילופי דברים.

  • בוט שיחה לא מקוון

    מערכת צ'אט אישית שרצה לחלוטין על מחשב נייד ישן ללא חיבור רשת.

איפה זה נופל

המגבלה הכי קשה כאן היא חלון הקשר של 2048 טוקנים בלבד. בשיחות תפקידים מתמשכות, ברגע שההיסטוריה מתמלאת, הדמות מתחילה לשכוח פרטים והאיכות צונחת במהירות. לא הייתי משתמש בזה למשחקים עלילתיים ארוכים.

בנוסף, מאגר האימון כולל תוכן מבוגרים ונוצר כולו בצורה סינתטית. המודל עלול לייצר תגובות בוטות או חסרות ניואנס אנושי, והוא מיועד לאנגלית בלבד ללא שום התאמה לשפות אחרות.

שאלות
נפוצות

האם אפשר לנהל איתו שיחה ארוכה בלי לאבד את האופי?

לא. חלון ההקשר מוגבל ל־2048 טוקנים, מה שאומר שאחרי כמה פסקאות ארוכות המודל ידרוס את ההתחלה ויתחיל להמציא מחדש את הדמות.

האם הוא מתאים לשימוש באפליקציה ציבורית?

רק אם אתם שמים שכבת סינון חזקה מעליו. המודל אומן על נתונים לא מצונזרים ועלול לפלוט תוכן מבוגרים ותשובות שלא מתאימות לקהל רחב.

איך מריצים

בגלל שמדובר במודל של 4 מיליארד פרמטרים, הדרישות נמוכות מאוד. גרסת ה־GGUF בכימות Q4_K_M שוקלת רק 2.5 גיגה-בייט, ואפשר להריץ אותה בקלות על מעבד רגיל או כרטיס מסך בסיסי עם llama.cpp, בלי שום צורך בחומרת שרתים יקרה.

גרסת F16 המלאה תדרוש כ־8 גיגה-בייט זיכרון. אם אתם צריכים רק שילוב מהיר בתוך כלי עצמאי, הרצה מקומית ב־GGUF עדיפה בהרבה על תשלום ל־API חיצוני, אבל צריך לזכור להשתמש בפורמט הצ'אט הנכון כדי שהתגיות יעבדו.

ollama run hf.co/Chun121/Qwen3-4B-RPG-Roleplay-V2:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון MIT מתיר שימוש מסחרי ואישי ללא הגבלות מיוחדות, כולל שינוי והפצה של הקוד והמשקלים. הדרישה היחידה היא לכלול את הודעת זכויות היוצרים המקורית במוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗