GPT
G

GLM-5.3-Flash-DFlash2

קוד פתוח

incoaicc-by-nc-nd-4.02026-08-27

  • transformers
  • safetensors
  • qwen3
  • dflash
  • dflash2

זה מודל טיוטה קטן שנועד להאיץ את GLM-5.3-Flash באמצעות speculative decoding. הוא מייצר בלוקים של טוקנים במקביל כדי שהמודל הראשי יאמת אותם מהר יותר.

  • 1.2Bפרמטרים
  • 1,048,576טוקנים בהקשר
  • 2.2 GBמשקל הקבצים
  • 13,302הורדות בחודש

מה זה

במקום לייצר טקסט באופן עצמאי, המודל הזה מתפקד כרכיב עזר שרץ לצד GLM-5.3-Flash. הוא משתמש בשיטה של block-diffusion כדי לחזות בלוק שלם של טוקנים במעבר בודד, שומר את המועמדים המובילים ובוחר ביניהם נתיב הגיוני בעזרת dynamic convolutions. המטרה היא להזין את המודל הגדול בהצעות מוכנות, בלי לפגוע בדיוק של התוצאה הסופית, שנשארת זהה לחלוטין לפלט של מודל היעד.

עם כ־1.2 מיליארד פרמטרים וחמש שכבות בלבד, הוא בנוי להיות קל וזריז מאוד כדי לא ליצור צוואר בקבוק בזמן החישוב. חלון ההקשר שלו מגיע למיליון טוקנים בהתאמה למודל הראשי, כך שהוא מסוגל להשתלב גם בפרומפטים ארוכים. נתוני מדידה רשמיים וביצועי מהירות עבור המשקל הספציפי הזה טרם פורסמו, והמפתחים מציינים שהם עדיין נמדדים מחדש.

מתאים ל

  • האצת שרתי הסקה מקומיים

    מוריד את זמני ההמתנה לטוקן ראשון ורציף בעבודה ישירה מול GLM-5.3-Flash בשרת SGLang ייעודי.

  • מחקר על block-diffusion

    משמש כדוגמה מעשית לבדיקת אלגוריתמי speculative decoding שמנחשים כמה טוקנים במקביל במקום סדרתית.

  • עיבוד טקסטים ארוכים

    תומך בחלון הקשר של מיליון טוקנים, ולכן מתאים לבדיקת חיסכון בזמני עיבוד של מסמכים גדולים במודל היעד.

איפה זה נופל

המודל הזה לא עובד כמודל עצמאי. אם תנסו לתת לו פרומפט רגיל, לא תקבלו תשובה, כי הוא יודע לפעול רק כחלק ממערך speculative decoding מול GLM-5.3-Flash. כרגע אין עבורו שום תוצאות מדידה או בנצ'מרקים בכרטיס, כך שאי אפשר לדעת מראש מה יהיה אחוז קבלת הטוקנים בפועל וכמה מהירות תרוויחו בעבודה אמיתית.

בנוסף, הוא מוגבל לארכיטקטורת DFlash2DraftModel ואינו מתאים לשום מודל מטרה אחר. כל עדכון או שילוב שלו בייצור תלוי בתמיכת תוכנה ניסיונית למדי ב־SGLang.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לבד לצ'אט או לכתיבת קוד?

לא. זה לא מודל שפה עצמאי, ואין לו יכולת לייצר תשובות ישירות למשתמש. הוא עובד אך ורק כרכיב טיוטה פנימי ששולח הצעות למודל הראשי GLM-5.3-Flash בתוך שרת תואם.

האם הפלט של המודל הראשי ישתנה או יהיה פחות מדויק בגלל הניחושים?

הפלט נשאר זהה לחלוטין. התהליך מוגדר כחסר אובדן, כך שכל טוקן שמנוחש עובר אימות מלא על ידי המודל הראשי, ובחירה אקראית שומרת בדיוק על התפלגות המקור.

אפשר להפעיל אותו עם מודלים אחרים כמו Llama או Mistral?

לא, המשקלים והאימון שלו מותאמים נקודתית ל־GLM-5.3-Flash. שימוש במודל טיוטה דורש התאמה ישירה למודל היעד כדי שהצעות הטוקנים יתקבלו באחוזים גבוהים.

איך מריצים

כדי להריץ אותו צריך להרים שרת הסקת מסקנות שתומך באלגוריתם DFLASH, כמו התקנה ספציפית של SGLang ממאגר הגיטהאב. המודל שוקל 2.2 גיגה־בייט בלבד, כך שמבחינת נפח זיכרון הוא דורש מעט מאוד VRAM נוסף מעבר למה שדורש מודל היעד GLM-5.3-Flash עצמו. הפקודה מחייבת לציין backend ייעודי לאקסטרקשן כמו fa4 ומתן הרשאת הרצת קוד מרוחק.

אם אין לכם כרטיס גרפי שמריץ בנוחות את המודל הראשי ושרת ייעודי שמנוהל נכון, אין שום היגיון להתעסק עם ההורדה שלו. במקרים כאלה עדיף לגשת ל־API מסחרי שמנהל את האופטימיזציות האלו ברקע בלי לדרוש הגדרות ידניות של מודלי טיוטה.

from transformers import pipeline

pipe = pipeline("text-generation", model="incoai/GLM-5.3-Flash-DFlash2")
print(pipe("שלום"))

הקבצים

5 קבצים במאגר, 2.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא CC BY-NC-ND 4.0, מה שאומר שהוא מיועד למחקר והערכה בלבד. נאסר כל שימוש מסחרי מכל סוג, ואי אפשר להפיץ גרסאות שעברו שינוי או אימון המשך. לשימוש במוצר חי או בסביבה עסקית חייבים לפנות ישירות לחברת incoai כדי לרכוש רישיון מסחרי נפרד.

הרישיון המלא בעמוד המודל ↗