GPT
D

dots3-note-prev

קוד פתוח

dots-studioapache-2.02026-08-09

  • transformers
  • safetensors
  • dots3_note
  • text-generation
  • dots3

מודל מולטימודלי פתוח שמקבל טקסט, תמונה, וידאו ואודיו, ומפעיל רק 16 מיליארד פרמטרים מתוך 280 מיליארד בכל טוקן. הוא נבנה לעיבוד הקשרים עצומים של עד חצי מיליון טוקנים.

  • 288Bפרמטרים
  • 524,288טוקנים בהקשר
  • 537 GBמשקל הקבצים
  • 2,341הורדות בחודש

מה זה

מדובר במודל Mixture of Experts מבית היוצר של Xiaohongshu שכולל 256 מומחים מנותבים ועוד אחד משותף, כאשר כל טוקן מפעיל שמונה מומחים בלבד. המבנה הזה נותן לו לרוץ בקצב של מודל קטן יחסית, למרות נפח כולל של מעל 280 מיליארד פרמטרים. בנוסף לקלט טקסטואלי, הוא מכיל אנקודר ראייה ייעודי במבנה MoE של 7 מיליארד פרמטרים ואנקודר אודיו של 800 מיליון פרמטרים, מה שמאפשר לו לנתח וידאו יחד עם פס הקול שלו.

הייחוד האמיתי כאן הוא חלון הקשר של 524,288 טוקנים בשילוב ארכיטקטורת קשב היברידית שמשלבת מנגנוני DSA ו־SWA ביחס של 1 ל־3. המפתחים שילבו שכבת חיזוי רב-טוקני משותפת שמקצרת את זמן יצירת הטוקנים בחצי דרך פענוח ספקולטיבי. למרות שהכרטיס מציג צילומי מסך של מדדים במשימות סוכן, תכנות ומולטימודל, הדוח המלא טרם שוחרר ולכן קשה לאמת עצמאית את הפער המדויק מול מודלים מתחרים.

מתאים ל

  • תמלול וניתוח וידאו ארוך

    המודל מעבד סרטונים מלאים יחד עם ערוץ השמע שלהם בתוך חלון של 512K טוקנים.

  • סוכנים עם זיכרון נרחב

    תמיכה מובנית ב־tool calling לצד הקשר ענק שמאפשר ריצה של לולאות חשיבה ארוכות.

  • ניתוח מסמכים ותרשימים

    אנקודר ראייה מבוסס MoE מאפשר תשאול של קובצי תמונה, גרפים ותרשימים טכניים.

איפה זה נופל

החיסרון המרכזי הוא שמדובר בגרסת preview מובהקת. הקוד עדיין לא נכנס רשמית לספריות המרכזיות, וספציפית ב־SGLang מצוין במפורש שאין כרגע תמיכה ב־Prefill CUDA graph. בנוסף, כל המבחנים והדוחות הטכניים המלאים הוגדרו ככאלה שיגיעו בקרוב, כך שאין כרגע תיעוד מפורט על הטיות, הזיות, או ביצועים בשפות שאינן אנגלית וסינית. אם המוצר שלכם צריך עברית, אל תבנו עליו לפני בדיקה מקיפה של הטוקנייזר ואיכות הפלט.

שאלות
נפוצות

האם אפשר להריץ את המודל על שרת עם שני כרטיסי GPU חזקים?

לא. גם גרסת ה־FP8 דורשת שרת שלם עם שמונה כרטיסי H100 כדי לחלק את המומחים ואת הזיכרון הנדרש להקשר הארוך. לשני כרטיסים המודל פשוט לא ייכנס.

האם יש תמיכה רשמית ויציבה בספריית transformers?

עדיין לא. התמיכה תלויה ב־Pull Request מספר 47844 שטרם מוזג לענף הראשי, ולכן תצטרכו להתקין את הספרייה ישירות מהענף הזה יחד עם תלויות כמו torchcodec ו־FFmpeg.

למה המודל מוגדר כ־280B אבל דורש פחות כוח חישוב בזמן ריצה?

בגלל ארכיטקטורת ה־MoE, שמנתבת כל טוקן לשמונה מומחים בלבד מתוך 256. בפועל רצים רק 16 מיליארד פרמטרים בכל צעד חישוב, מה שחוסך זמן עיבוד פר טוקן אך עדיין דורש זיכרון מלא למשקלים.

איך מריצים

כדי להריץ את גרסת ה־BF16 המקורית, ששוקלת 537 גיגה-בייט, תצטרכו תשתית מרובת שרתים עם נפח זיכרון עצום. המפתחים עצמם מכוונים לגרסת ה־FP8, וגם עבורה צריך צומת של 8 מעבדי GPU כמו NVIDIA H100 עם שילוב של Tensor Parallelism ו־Expert Parallelism כדי להתמודד עם המשקל ועם חלון ההקשר המלא. ההרצה דורשת שרת ייעודי כמו vLLM מגרסאות אחרונות או SGLang מאימג' ייעודי.

אם אין לכם קלאסטר כזה פנוי בחווה המקומית או בענן, עדיף להשתמש בנקודת הקצה החינמית ב־OpenRouter או ב־API חיצוני. התחזוקה של צומת שמונה כרטיסים יקרה מדי עבור ניסויים ראשוניים, בטח כשהקוד ב־Transformers ו־SGLang עדיין יושב ב־Pull Requests פתוחים ומחייב התקנות מגרסאות פיתוח.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="dots-studio/dots3-note-prev")
print(pipe("שלום"))

הקבצים

157 קבצים במאגר, 537 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המשקלים וקוד המודל משוחררים תחת רישיון Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו במוצרים סגורים ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים של Xiaohongshu ועל נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗