GPT
W

WeDLM-8B-Instruct

קוד פתוח

tencentapache-2.02025-12-25

  • transformers
  • safetensors
  • wedlm
  • text-generation
  • language model

זה מודל דיפוזיה לשפה שמפענח טוקנים במקביל ומאיץ ריצה פי כמה ממודלים רגילים באותו סדר גודל. הוא מכוון למי שצריך תגובות מהירות מאוד במתמטיקה ובקוד בלי לאבד דיוק.

  • 8.2Bפרמטרים
  • 16,384טוקנים בהקשר
  • 15.3 GBמשקל הקבצים
  • 250הורדות בחודש

מה זה

מדובר במודל שפה מבוסס דיפוזיה שעבר כיוונון להוראות על בסיס Qwen3-8B. הרעיון המרכזי כאן הוא פענוח מקבילי שנשען על מנגנון תשומת לב סיבתי רגיל, מה שמאפשר לו להשתמש בטכנולוגיות זיכרון מוכרות כמו FlashAttention או PagedAttention בלי להמציא את הגלגל מחדש.

התוצאות במבחנים מראות שהוא מנצח את מודל המקור ברוב המשימות, למשל ציון של 80.49 מול 71.95 בייצור קוד ב־HumanEval, ו־92.27 מול 89.91 ב־GSM8K. היתרון הגדול מתבטא בזמני הריצה, הוא מהיר פי 3 עד 6 מפתרונות מקבילים במתמטיקה ופי 2 עד 3 בכתיבת קוד, כי מבנים דטרמיניסטיים מאפשרים לו לייצר כמה טוקנים יחד במקום לזחול טוקן אחרי טוקן.

מתאים ל

  • ייצור קוד בזמן אמת

    מייצר פונקציות במהירות כפולה ממודלים רגילים ומוציא ציון של 80.49 ב־HumanEval.

  • פתרון בעיות חישוב

    מציג האצה של עד פי 6 בפתרון שלבי מתמטיקה בזכות מבנה תשובות צפוי.

  • שרתי בדיקות אוטומטיות

    מתאים לעיבוד מהיר של אצוות טקסט באנגלית הודות לתמיכה מלאה ב־PagedAttention.

איפה זה נופל

המודל תומך רשמית באנגלית ובסינית בלבד, כך שאין כאן תמיכה בעברית מחוץ לקופסה. בנוסף, במבחן המתמטיקה המורכב MATH הוא השיג 64.8 לעומת 69.6 במודל הבסיס של Qwen, כלומר בחשיבה מתמטית עמוקה יש ירידה מסוימת ברמה.

מבחינת המהירות, ביתרון המקבילי מרגישים בעיקר בטקסטים צפויים כמו תחביר של קוד. בשאלות פתוחות עם אנטרופיה גבוהה המהירות צונחת לפי 1.5 עד 2 בלבד, כך שלא בכל משימה תראו את ההאצה הדרמטית.

שאלות
נפוצות

האם הוא יעבוד טוב בעברית?

לא. המודל אומן והוגדר רשמית עבור אנגלית וסינית בלבד. אם תזינו לו עברית תקבלו תוצאות שבורות או חוסר הבנה, ואין טעם להשתמש בו למשימות מקומיות בלי אימון ייעודי נוסף.

אפשר להריץ אותו ישר דרך ספריית transformers?

טכנית כן, אבל זה מפספס את כל המטרה של הפרויקט. טעינה דרך הממשק הרגיל עובדת בצורה סדרתית ולא מנצלת את מנגנון הדיפוזיה המקבילי, כך שבשביל מהירות גבוהה חייבים להתקין את המנוע של wedlm.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם לפחות 16 עד 24 גיגה זיכרון כדי להחזיק את 15.3 הגיגה של המשקלים לצד שכבת הקאש. ההתקנה דורשת סביבת לינוקס עם תאימות ל־CUDA 12.9 או 12.4, וקימפול של ספריית flash-attn בגרסה ייעודית, או שימוש ישיר בקונטיינר הדוקר הרשמי שהם מספקים.

בשביל לקבל את מהירות הריצה שהם מבטיחים חייבים להשתמש במנוע wedlm שנבנה במיוחד עבורו. אפשר לטעון אותו גם דרך transformers הרגיל של Hugging Face, אבל היוצרים מבהירים שזה מיועד רק לאימון או לבדיקות פשוטות, ובמצב כזה כל יתרון הביצועים בפענוח הולך לאיבוד.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/WeDLM-8B-Instruct")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗