GPT
D

DASD-4B-Thinking

קוד פתוח

Alibaba-Apsaraapache-2.02025-12-25

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

מודל חשיבה קומפקטי שמביא ביצועי פתרון בעיות של מערכות ענק לגודל של ארבעה מיליארד פרמטרים בלבד. הוא מתאים למי שחייב הסקת מסקנות מתמטית ותכנותית בלי להחזיק שרת יקר.

  • 4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 134הורדות בחודש

מה זה

מדובר במודל שמבוסס על Qwen3 ועבר זיקוק מודרך ממודל מורה עצום של 120 מיליארד פרמטרים. התהליך הזה התבסס על יישור התפלגויות בעזרת 448 אלף דוגמאות אימון בלבד, במקום מיליוני דוגמאות כמקובל. המטרה כאן היא חשיבה רציפה וארוכה לפני מתן התשובה הסופית, מה שמאפשר לו להתמודד עם שאלות מורכבות במדעים, קוד ואלגוריתמיקה.

במבחני ביצועים הוא עוקף מודלים פתוחים שגדולים ממנו בהרבה. במבחן המתמטיקה התחרותי AIME25 הוא מקבל ציון של 83.3, מעל דגמים מוכרים כמו Qwen3 של 32 מיליארד פרמטרים או דיפסיק של 8 מיליארד. במבחן כתיבת הקוד LiveCodeBench גרסה שש הוא עומד על 67.5, תוצאה שמראה שהוא לא רק מנחש נכון תבניות אלא מצליח להרכיב רצף לוגי תקין לפתרון בעיות אמיתיות.

מתאים ל

  • פתרון בעיות מתמטיקה

    מייצר שרשראות חשיבה מפורטות ומגיע לדיוק גבוה מאוד במבחני AIME בלי שרתים כבדים.

  • ניתוח וכתיבת אלגוריתמים

    עוזר לפתח ולבדוק קטעי קוד מורכבים במכונה מקומית בזכות ביצועים חזקים במבחני LiveCodeBench.

  • שרת מקומי למשימות לוגיות

    מאפשר הרצת מודל הסקת מסקנות חכם בתוך רשת ארגונית סגורה על כרטיס גרפי צרכני פשוט.

איפה זה נופל

המודל מוגבל לחלוטין למרחב הטקסטואלי הטהור. אין לו שום תמיכה בחיבור לכלים חיצוניים, ב־function calling או בהפעלת מפרש קוד כדי לבדוק את עצמו תוך כדי ריצה. מי שבונה סוכן אוטומטי שצריך לפנות למסדי נתונים ולקרוא ל־API יצטרך לכתוב את כל המעטפת ולפרסר את הטקסט ידנית. בנוסף, חשיבה ארוכה מייצרת כמות גדולה של טוקנים לפני התשובה, מה שמייצר זמני תגובה איטיים ביחס למודלים רגילים מאותו גודל.

אותה משפחה

DASD יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הוא מתאים לשימוש כעוזר אישי שמבצע פעולות במערכת?

לא באופן ישיר. הכרטיס מציין במפורש שאין לו יכולות הפעלת פונקציות או כלים חיצוניים, ולכן הוא יודע רק לפלוט טקסט ולא לתקשר עם העולם שבחוץ.

למה התשובות שלו לוקחות זמן למרות שהוא שוקל רק 4B?

הוא מודל חשיבה שמייצר תהליך הסקה פנימי ארוך בטקסט לפני שהוא עונה. כמות הטוקנים שהוא פולט לכל שאלה גדולה בהרבה ממודל שיחה רגיל.

איך מריצים

המשקל הכולל של הקבצים עומד על 7.5 גיגה בייט בדיוק של bfloat16, כך שכרטיס מסך ביתי בודד עם 12 או 16 גיגה זיכרון מריץ אותו בלי שום בעיה. אפשר להעלות אותו ישירות דרך ספריות כמו vLLM או sglang עם שורת פקודה אחת ולקבל שרת תואם ממשק של OpenAI. המפתחים מדגישים שחובה להשתמש ב־system prompt המקורי כדי לשמור על איכות הפלט, וממליצים לעבוד בהגדרות דגימה של temperature ו־top_p בערך של 1.0 בדיוק.

אם אתם מתכננים לנצל את מלוא חלון ההקשר שלו, שמגיע ל־262,144 טוקנים, תצטרכו הרבה יותר זיכרון עבור טבלת ה־KV, ובמקרה כזה כרטיס בודד רגיל כבר ייחנק. שם עדיף לשקול פיצול על כמה כרטיסים או להשתמש בספק ענן שמחזיק תשתית מתאימה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Alibaba-Apsara/DASD-4B-Thinking")
print(pipe("שלום"))

הרישיון

המשקלים מופצים תחת רישיון Apache 2.0 המלא. זה אומר שמותר להשתמש בהם לכל מטרה, כולל מוצרים מסחריים, מותר לשנות אותם, לאמן עליהם הלאה ולהפיץ אותם מחדש, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗