GPT
Q

Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V13-GGUF

קוד פתוח

LuffyTheFoxapache-2.02026-07-13

  • hermes
  • gguf
  • uncensored
  • qwen3.6
  • moe

גרסת קוד פתוח לא מצונזרת של Qwen מבוססת תערובת מומחים. היא מיועדת למי שצריך מודל שלא מסרב לפקודות וכולל יכולות ראייה וקריאת פונקציות.

  • 117 GBמשקל הקבצים
  • 906,696הורדות בחודש
  • 606לייקים

מה זה

מדובר בשילוב בין בסיס לא מצונזר של HauhauCS לבין נתונים מכוונון Hermes, שעבר עיבוד מתמטי של משקולות הטנזורים במקום אימון רגיל. המודל בנוי בארכיטקטורת תערובת מומחים עם שלושים וחמישה מיליארד פרמטרים בסך הכול, אבל מפעיל רק כשלושה מיליארד בכל שלב קדימה. המבנה שלו משלב תשומת לב ליניארית מסוג DeltaNet יחד עם מנגנון רגיל, ומכיל מאתיים חמישים ושישה מומחים שמתוכם שמונה מנותבים ואחד משותף לכל טוקן.

המטרה מאחורי הגרסה הזו היא ניקוי רעשים במשקולות באמצעות פירוק ערכים סינגולריים וחוק מרצ׳נקו פסטור, מה שאמור לייצב את הפלטים בלי לפגוע בידע שנלמד. לפי נתוני הבסיס המקוריים, הוא רשם אפס סירובים מתוך ארבע מאות שישים וחמש בדיקות. המודל תומך בטקסט, תמונות ווידאו, ומכיל חלון הקשר טבעי של מאתיים שישים ושניים אלף טוקנים שניתן להרחבה עד מיליון.

מתאים ל

  • סוכן חכם להפעלת פונקציות

    הוא כולל התאמה לפורמט פקודות של Hermes ומאפשר החזרת מבני JSON מדויקים לפי סכמה.

  • ניתוח תמונה ווידאו מקומי

    מבנה מולטימודלי מובנה שמאפשר להזין מדיה יחד עם הנחיות טקסט ישירות על המחשב.

  • כתיבת קוד במצב חשיבה

    הגדרות טמפרטורה ייעודיות מאפשרות לו להפעיל שרשרת חשיבה מובנית למשימות תכנות.

איפה זה נופל

המודל מבוסס על הסרת חסימות מוחלטת עם אפס סירובים בבדיקה, ולכן הוא לא מסנן תוכן פוגעני, מסוכן או בעייתי. הטיפול בטנזורים נעשה באמצעות מניפולציה מתמטית ישירה על בייטים בסביבת קולאב חינמית ולא באימון מסודר מחדש, מה שעלול לייצר חוסר יציבות לא צפוי. בנוסף, יכולות הראייה דורשות קובץ נפרד שלא תמיד נטען בצורה חלקה בכל סביבת הרצה, ומצב החשיבה דורש שמירה על הקשר עצום שתופס המון זיכרון.

שאלות
נפוצות

איך מפעילים את התמיכה בתמונות?

צריך להוריד את קובץ ה־mmproj המתאים ולהניח אותו לצד קובץ ה־GGUF הראשי בתוכנת ההרצה שלכם. ללא הקובץ הזה, המודל יפעל במצב טקסט בלבד ולא יזהה תמונות או וידאו.

למה המפתח ממליץ להשאיר הקשר של 128K לפחות?

מצב החשיבה והיציבות של המודל תלויים במרחב עבודה רחב בזיכרון. צמצום חלון ההקשר מתחת לרף הזה פוגע ביכולת שלו לבצע תהליכי הסקה ארוכים לפני מתן התשובה.

מה המשמעות של אפס סירובים בעבודה מעשית?

המודל לא מפעיל שום מנגנון בטיחות פנימי ויענה על כל בקשה בלי לחסום אותה. אם אתם בונים מוצר שחשוף למשתמשי קצה, תצטרכו לבנות שכבת סינון ובקרה חיצונית משלכם.

איך מריצים

כדי להריץ אותו צריך כלי שתומך בקובצי GGUF כמו llama.cpp, LM Studio או koboldcpp, עם דגל jinja לתבנית השיחה וקובץ mmproj נפרד לעיבוד תמונה. המפתח ממליץ על קוונטיזציות מסוג NVFP4 או APEX, דורש להגדיר שמונה מומחים פעילים, ומציע לשמור על הקשר של מאה עשרים ושמונה אלף טוקנים לפחות כדי לא לאבד את מצב החשיבה.

מבחינת חומרה, קבצי המאגר שוקלים מאה ושבעה עשר גיגה בייט בחלוקה לחמישה עשר קבצים. ההרצה דורשת פריקה מלאה של כרטיס המסך יחד עם העברת שכבות MoE למעבד לפי הצורך, ומטמון K ו־V ברמת F16. אם אין לכם מעבד גרפי חזק עם זיכרון וידאו ייעודי משמעותי, המודל הזה יזחל או יקרוס, ובמצב כזה שווה לבדוק ממשקי API שמריצים מודלי ראייה גדולים מרחוק.

ollama run hf.co/LuffyTheFox/Qwen3.6-35B-A3B-Uncensored-Genesis-Hermes-V13-GGUF:Hermes3.6-35B-A3B-Uncensored-Genesis-V13-MTP-APEX-Compact

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא אפאצ'י שתיים אפס. הוא מתיר שימוש מסחרי, שינוי קוד והפצה חופשית בלי תמלוגים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי. מי שרוצה להטמיע את המשקולות במוצר יכול לעשות זאת, אך נושא באחריות המלאה לפלטים של מודל לא מצונזר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗