GPT
Q

Qwen3.5-27B-NVFP4

קוד פתוח

apolo13xapache-2.02026-02-26

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • quantized

גרסה מכווצת בדיוק של FP4 למודל שמשלב טקסט ותמונה. מקבלים כאן יכולות עיבוד חזקות בחצי מהמשקל המקורי ובלי לאבד כמעט דיוק.

  • 17Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.4 GBמשקל הקבצים
  • 1,453הורדות בחודש

מה זה

המודל הזה לוקח תמונות וטקסט ומחזיר טקסט, כשהוא דוחס את המקור של 27B לתוך 18.4 גיגה בלבד במקום 51.8 גיגה. הכיווץ נעשה באמצעות llm-compressor על משקולות ואקטיבציות בפורמט NVFP4, עם 512 דגימות כיול.

במבחני ביצועים עם מנגנון חשיבה דולק, הוא שומר על 99.1 אחוז מהדיוק של המודל המלא. בבדיקות כמו GPQA Diamond שמודד ידע מדעי מורכב הוא ירד מ־80.30 ל־79.29 אחוז, וב־IFEval שבודק מעקב אחרי הוראות הוא שמר על 93.88 אחוז לעומת 95.08 במקור. ב־MMLU-Redux הוא אפילו עקף מעט את המקור עם 94.32 אחוז.

מתאים ל

  • ניתוח מסמכים ותמונות

    הוא מקבל תמונה ומחזיר טקסט מדויק, במשקל קובץ נמוך שמתאים לשרת בודד.

  • מעקב אחר הוראות קשיחות

    תוצאת ה־IFEval שלו מגיעה לכמעט 94 אחוז, מה שמבטיח פלטים במבנה מדויק.

  • פתרון בעיות עם חשיבה

    מצב החשיבה המובנה עובד מצוין בשאלות מדעיות מורכבות לפי מבחן GPQA.

איפה זה נופל

למרות השחזור המרשים במבחנים, מדובר בכיול שהתבסס על 512 דוגמאות בלבד. פורמט של 4 ביט עלול להציג שגיאות מוזרות במשימות שלא נבדקו בכיול, בייחוד בניתוח תמונות עמוסות בפרטים. בנוסף, חלון ההקשר הענקי של 262 אלף טוקנים ידרוש זיכרון וידאו עצום אם תנסו לנצל אותו במלואו, הרבה מעבר למשקל הבסיסי של הקבצים.

שאלות
נפוצות

איזה כרטיס מסך צריך בשביל להריץ אותו?

המשקל הוא 18.4 גיגה, מה שאומר שכרטיס עם 24 גיגה זיכרון יספיק להרצה בסיסית. יחד עם זאת, חייבים מעבד גרפי של אנבידיה שתומך בארכיטקטורת NVFP4 כדי לנצל את הדחיסה הזו בפועל.

כמה ביצועים מאבדים בגלל הכיווץ מול המקור?

לפי נתוני הבדיקה, כמעט כלום. הממוצע של המודל המכווץ עומד על 89.16 אחוז לעומת 89.76 אחוז במודל המקורי, שזה שימור של מעל 99 אחוז מהיכולת.

איך מריצים

המודל דורש גרסת vLLM nightly מהתאריך 27 בפברואר 2026, ומריצים אותו עם דגל לפענוח חשיבה של qwen3 וזכרון מטמון מופעל. קובצי המודל שוקלים 18.4 גיגה, כך שכרטיס מסך מודרני של 24 גיגה יכול להחזיק אותו, בתנאי שיש לו תמיכה בחומרת FP4 של אנבידיה.

אם אין לכם כרטיס תומך בארכיטקטורה הזו או שאתם לא רוצים להסתבך עם גרסאות פיתוח לא יציבות של vLLM, פנייה ל־API חיצוני תחסוך את כאב הראש.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="apolo13x/Qwen3.5-27B-NVFP4")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שאתם מפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗