GPT
Q

Qwen3.5-4B-DFlash

קוד פתוח

z-labapache-2.02026-03-05

  • transformers
  • safetensors
  • qwen3
  • feature-extraction
  • dflash

זהו מודל טיוטה קטן שנועד להאיץ את Qwen3.5-4B באמצעות פענוח ספקולטיבי. מריצים אותו כדי להכפיל את קצב פליטת הטוקנים בלי לשנות את התוצאה הסופית של מודל המטרה.

  • 634Mפרמטרים
  • 262,144טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 6,749הורדות בחודש

מה זה

המודל הזה שוקל 1.2 גיגה בייט בלבד ומכיל 634 מיליון פרמטרים על גבי שש שכבות. הוא לא מייצר טקסט עצמאי עבור משתמש קצה, אלא מנחש בלוקים של טוקנים במקביל עבור מודל היעד הגדול יותר, שמאמת אותם ומחליט מה לאשר. המפתחים אימנו אותו עם חלון הקשר של 40 אלף טוקנים ותשומת לב בחלון נע כדי לשמור על יציבות בריצות ארוכות.

בבדיקות של המפתחים מול מנגנון הטיוטה המובנה של קוון, המודל הזה סיפק קצב גבוה יותר בכל תרחיש שנבדק. בעומס של בקשה בודדת הוא הגיע להאצה של פי 4.6 במשימות קוד, ובעומס של 32 בקשות במקביל ההאצה עמדה על פי 2.6 במשימות מתמטיקה. המשמעות המעשית היא שצווארי בקבוק בזמן ההסקה מצטמצמים משמעותית בלי לגעת באיכות התוכן שהמודל המקורי פולט.

מתאים ל

  • האצת שרתי קוד מקומיים

    הוא מגיע להאצה של פי 4.6 במשימות קוד בבקשה בודדת, מה שמקצר את זמן ההמתנה לפתרון.

  • טיפול בעומס של משתמשים

    בעבודה מקבילית של 32 בקשות הוא מכפיל את כמות הטוקנים לשנייה בלי לפגוע באיכות הפלט.

  • הסקה עם הקשר ארוך

    האימון הייעודי על רצפים ארוכים מאפשר לשמור על קצב מהיר גם בפרומפטים כבדים.

איפה זה נופל

החיסרון המרכזי הוא שמדובר בחלק ממערך ולא במוצר שעומד בפני עצמו. אי אפשר לשלוח אליו פרומפט ישיר ולקבל תשובה, והוא דורש התאמה מדויקת לגרסת Qwen3.5-4B. בנוסף, כל התוצאות המרשימות נמדדו על חומרת קצה חזקה במיוחד של אנבידיה עם ספריות אופטימיזציה ייעודיות, כך שמי שמריץ על כרטיסים ישנים או בתצורות תוכנה שונות לא בהכרח יראה שיפור דומה.

שאלות
נפוצות

אפשר להריץ את המודל הזה לבד כדי לקבל תשובות לטקסט?

לא. זהו מודל טיוטה קטן שחייב לרוץ לצד Qwen3.5-4B בתוך שרת הסקה מתאים. תפקידו רק להציע טוקנים לבדיקה ולא לייצר תשובות סופיות בעצמו.

האם המודל הזה משנה את איכות התשובות או גורם להזיות?

לא, חלוקת ההסתברויות של מודל המטרה נשמרת במלואה. מודל היעד בודק ומאשר כל טוקן שהטיוטה מציעה, כך שהתוצאה זהה לחלוטין לריצה רגילה.

איך מריצים

כדי להריץ אותו צריך שרת הסקה שתומך באלגוריתם הזה, כשהתמיכה המרכזית כרגע נמצאת בגרסאות עדכניות של אס ג'י לאנג. המפתחים בדקו אותו על כרטיס בלאקוול בי 200 בודד עם הגדרות ספציפיות כמו בלוק בגודל 8 לעומסים מרובי משתמשים או גודל 16 לבקשות בודדות.

אם סביבת העבודה שלכם מבוססת על וי אל אל אם, התמיכה שם עדיין תלויה במיזוג של בקשת משיכה פתוחה ולא עובדת ישירות מהקופסה. מי שלא מחזיק חומרה מתאימה להרצת שני המודלים במקביל על אותו שרת ימצא ששירותי ענן מנוהלים פשוטים בהרבה לתחזוקה.

from transformers import pipeline

pipe = pipeline("text-generation", model="z-lab/Qwen3.5-4B-DFlash")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא אפאצ'י 2.0. מותר להשתמש בו במוצרים מסחריים, לשנות את הקוד ולהפיץ אותו בחופשיות. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים ונוסח הרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗