GPT
H

Huihui-ThinkingCap-Qwen3.6-27B-abliterated-NVFP4

קוד פתוח

sakamakismileapache-2.02026-07-12

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • qwen3_6

גרסה מכווצת ומבוטלת סירובים למודל חשיבה וראייה, שנועדה לחסוך טוקנים ולרוץ מהר על שרתים מקומיים. היא מתאימה למי שרוצה מודל מנמק שלא נעצר מול שאלות רגישות.

  • 17Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 2,999הורדות בחודש

מה זה

המשקל הזה לוקח את המודל הבסיסי ומחבר שלושה שינויים משמעותיים. הבסיס עבר אימון לקצר את תהליך החשיבה בכ־46 אחוז בהשוואה למודל המקורי, בלי לוותר על איכות ההסקה. בנוסף, הוסרו ממנו מנגנוני הסירוב המובנים, כך שהוא עונה ישירות על בקשות שבדרך כלל נחסמות. כל זה נארז בכימוס NVFP4 קל משקל.

הארכיטקטורה משלבת שכבות תשומת לב היברידיות לצד רכיב חזותי וראש פענוח ספקולטיבי שנשמרו ברמת דיוק מלאה של 16 ביט. השילוב הזה שומר על מהירות יצירה גבוהה במיוחד, כשהמודל מייצר פחות טוקנים של מחשבה פנימית ופולט את הפלט מהר יותר על החומרה המתאימה. הוא כולל תמיכה באנגלית, יפנית וסינית, לצד יכולות ראייה וקריאת תמונות מובנות.

מתאים ל

  • חשיבה ללא צנזורה

    מענה על נושאים מורכבים או בדיקות אבטחה בלי להיתקל בסירובים אוטומטיים.

  • הסקה מהירה מקומית

    קיצור שרשרת החשיבה ב־46 אחוז חוסך זמן ומאפשר לקבל תשובות מהירות על השרת.

  • ניתוח מסמכים ותמונות

    עיבוד קלט חזותי וטקסטואלי יחד הודות לרכיב הראייה שנשמר בדיוק מלא.

איפה זה נופל

ביטול הסירובים משנה את התנהגות המודל ולפעמים גורם לו לפספס הוראות עדינות או לסטות מהקשר. בנוסף, חובה להגדיר תקציב פלט של 4,096 טוקנים לפחות. אם תגדירו מגבלת פלט קצרה מדי, המודל עלול לבזבז את כל המקום בתוך תגיות החשיבה ולהחזיר תשובה ריקה לחלוטין. הוא גם לא עבר התאמה ייעודית לעברית, ולכן השפות המרכזיות בו נשארות אנגלית, סינית ויפנית.

שאלות
נפוצות

האם המודל ידבר איתי בעברית?

השפות הרשמיות שלו הן אנגלית, יפנית וסינית. אפשר לפנות אליו בעברית כי הבסיס מכיר שפות נוספות, אבל התשובות עשויות להיות פחות מדויקות או להתערבב עם אנגלית, ולכן עדיף להריץ משימות קריטיות באנגלית.

למה המודל מחזיר לפעמים פלט ריק?

זה קורה בעיקר אם מגבלת הטוקנים לפלט נמוכה מדי. המודל מייצר קודם מחשבות פנימיות בתוך תגיות ייעודיות, ואם התקציב נגמר לפני שהוא מסיים לחשוב, לא נשאר לו מקום להפיק את התשובה הסופית. מומלץ לקבוע תקציב של 4,096 טוקנים ומעלה.

איך מריצים

כדי להריץ אותו צריך vLLM בגרסה 0.21 ומעלה ותמיכה בפורמט NVFP4. המודל שוקל כ־19.2 ג'יגה־בייט, וכדי לקבל ביצועים טובים וחלון הקשר גדול מומלץ לחלק אותו על פני לפחות שניים או ארבעה כרטיסי מסך באמצעות פרלליזם. רכיב ה־MTP המובנה כבר מוגדר בתוך הקבצים ומאפשר פענוח ספקולטיבי חלק בלי התאמות מיוחדות.

אם אין לכם כרטיסי מסך ייעודיים עם תמיכה בארכיטקטורת FP4 של אנבידיה, עדיף לפנות ל־API חיצוני או להשתמש בגרסה בכימוס מסורתי יותר. הכימוס הזה דורש נתיבי ביצוע ספציפיים וכרטיסים שלא תומכים בפורמט פשוט ייכשלו בטעינה או יזחלו בביצועים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="sakamakismile/Huihui-ThinkingCap-Qwen3.6-27B-abliterated-NVFP4")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 שמאפשר שימוש מסחרי מלא, שינוי קוד והפצה מחדש. אין כאן הגבלות מיוחדות מעבר לשמירה על הצהרת זכויות היוצרים של היוצרים המקוריים, כך שאפשר לשלב אותו במוצרים פנימיים או מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗