GPT
D

dots.llm1.inst

קוד פתוח

dots-studiomit2025-05-14

  • transformers
  • safetensors
  • dots1
  • text-generation
  • chat

מודל שיחה מבוסס תערובת מומחים שמפעיל 14 מיליארד פרמטרים בלבד בכל ריצה, אך שומר על קיבולת של 142 מיליארד. הוא מתאים למי שמחפש ביצועים של מודל ענק עם זמני תגובה מהירים בהרבה.

  • 143Bפרמטרים
  • 32,768טוקנים בהקשר
  • 266 GBמשקל הקבצים
  • 953הורדות בחודש

מה זה

מדובר במודל MoE עם כוונון הוראות שפותח על ידי rednote וכולל 142 מיליארד פרמטרים בסך הכול, מתוכם רק 14 מיליארד פעילים בזמן יצירת פלט. הארכיטקטורה מבוססת על בחירה של שישה מומחים מתוך 128 יחד עם שני מומחים משותפים קבועים. היוצרים מציינים שהאימון המקדים התבצע ללא מידע סינתטי כדי להגיע לרמת ביצועים שמקבילה ל־Qwen2.5-72B.

בפועל, המשמעות של השוואה כזו היא יכולת להגיע לדיוק של מודל צפוף במשקל בינוני־כבד, אבל עם קצב הפקת טוקנים שדומה למודל קטן של 14B. המודל מתמקד בשפות אנגלית וסינית, וכולל חלון הקשר של 32,768 טוקנים.

מתאים ל

  • שרתי שיחה באנגלית ובסינית

    הפעלת 14B בלבד מאפשרת זמני תגובה מהירים במערכות שירות מרובות משתמשים.

  • עיבוד טקסטים ומחקר עצמאי

    רישיון MIT מאפשר הטמעה מלאה בתוך מוצרים מסחריים בלי תלות במדיניות שימוש מגבילה.

  • מחקר על תערובת מומחים

    השילוב של 128 מומחים מנותבים ושניים משותפים מתאים לניתוח התנהגות של MoE רחב.

איפה זה נופל

התמיכה הרשמית מוגבלת לשפות אנגלית וסינית בלבד. אין שום תיעוד או עדות לאימון על עברית, כך שלא כדאי לבנות עליו לפרויקטים מקומיים בלי בדיקה ידנית מעמיקה של הפלט.

בנוסף, המודל משתמש בקוד ארכיטקטורה מותאם שאינו חלק מובנה בליבה של transformers הוותיקה, ומחייב הרצה עם trust remote code או תלויות תוכנה ייעודיות כמו תמונת דוקר ייעודית. חלון ההקשר מוגבל ל־32K טוקנים, נתון סביר אך נמוך ביחס לסטנדרט הנוכחי של מודלים חדשים.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב אישי או כרטיס מסך בודד?

לא. הקבצים שוקלים 266GB והמודל דורש פיצול של שמונה כרטיסים במקביל. תצטרכו שרת ייעודי כדי לטעון אותו.

איך הביצועים של המודל בעברית?

החומר הרשמי מציין תמיכה באנגלית ובסינית בלבד. מודלים כאלה נוטים לייצר עברית משובשת, ולא מומלץ להסתמך עליהם בלי כוונון ייעודי.

מה היתרון של מבנה ה־MoE במקרה הזה?

המודל מחזיק ידע של 142 מיליארד פרמטרים, אבל מחשב רק 14 מיליארד בכל שלב. זה מביא חיסכון משמעותי בזמן החישוב לכל טוקן.

איך מריצים

כדי להריץ אותו מקומית צריך שרת עם שמונה כרטיסי מסך מודרניים. המשקל הכולל של הקבצים עומד על 266GB בדיוק bfloat16, מה שדורש זיכרון VRAM עצום רק כדי לטעון אותו לפני שמתחילים להקצות מקום לזיכרון הקשר. ההרצה דורשת חלוקה של שמונה חלקים מקבילים, tensor parallel של 8, דרך מנועים כמו vLLM או SGLang.

בשל המשקל העצום, אלא אם יש לכם צבר שרתים פעיל ומאובטח שחייב לרוץ ברשת סגורה, עדיף להשתמש בספקי API חיצוניים. התחזוקה של מכונה עם שמונה מאיצים רק בשביל ניסויים אינה משתלמת לרוב הצוותים.

from transformers import pipeline

pipe = pipeline("text-generation", model="dots-studio/dots.llm1.inst")
print(pipe("שלום"))

הקבצים

85 קבצים במאגר, 266 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי קוד והפצה מחדש במוצרים סגורים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗