GPT
T

Tongyi-DeepResearch-30B-A3B

קוד פתוח

Alibaba-NLPapache-2.02025-09-16

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

מודל מומחים שמיועד למחקר עמוק וחיפוש מידע מורכב. הוא מפעיל רק שלושה מיליארד פרמטרים מתוך שלושים ואחד בכל צעד, מה שנותן מהירות גבוהה במשימות חקירה ארוכות.

  • 31Bפרמטרים
  • 131,072טוקנים בהקשר
  • 56.9 GBמשקל הקבצים
  • 37,916הורדות בחודש

מה זה

עליבאבא בנו כאן כלי שמכוון ישירות לעבודה של סוכנים אוטונומיים, ספציפית איסוף מידע וסריקת רשת מתמשכת. המבנה שלו מבוסס על ארכיטקטורת תערובת מומחים שנקראת Qwen3MoeForCausalLM. בפועל, מתוך 30,532,122,624 פרמטרים שיושבים בזיכרון, רק שלושה מיליארד רצים בכל טוקן. זה שומר על עלות חישוב נמוכה יחסית בזמן הריצה עצמה, למרות שהמשקל הכללי עדיין תופס מקום של מודל בינוני.

הוא אומן בלמידת חיזוק מקצה לקצה בשיטת Group Relative Policy Optimization ומותאם לשני מצבי עבודה, ReAct רגיל ומצב IterResearch שנועד לסחוט ביצועים בעזרת הגדלת זמן ההסקה. במבחנים של עבודה ארוכת טווח, כמו GAIA, WebWalkerQA, FRAMES וחיפוש בדפדפן, המטרה שלו היא לפתור בעיות שדורשות המון צעדי ביניים בלי ללכת לאיבוד בדרך.

מתאים ל

  • סוכן חקירה אוטונומי

    איסוף מידע רב שלבי ממקורות שונים ברשת בזכות אימון ייעודי למשימות GAIA וחיפוש ארוך טווח.

  • ניתוח מסמכים מסיבי

    עיבוד טקסטים ארוכים במיוחד בעזרת חלון הקשר של 131,072 טוקנים ויכולת איתור עובדות מורכבת.

  • הסקה במצב ReAct

    ביצוע פעולות מדורגות עם תהליך מחשבה ופעולה מובנה שנתמך ישירות בארכיטקטורת המודל.

איפה זה נופל

השפה המוגדרת במודל היא אנגלית בלבד. מי שבונה על מחקר בעברית יגלה מהר מאוד שהביצועים לא שם, כי האימון וההתאמה התרכזו באנגלית ובמבחנים סיניים כמו BrowserComp-ZH. מעבר לזה, המודל מתמחה בהסקה ובחיפוש מידע ברשת. הוא לא נבנה כמודל שיחה כללי וסתמי, ושימוש בו לצ'אט פשוט יהיה בזבוז משאבים מוחלט. צריך גם לבדוק היטב את אמינות התוצאות במשימות רגישות, כי סוכני מחקר עדיין מועדים להזיות כשהם מתמודדים עם שאילתות מפותלות.

שאלות
נפוצות

האם אפשר להריץ אותו על חומרה צנועה בגלל שרק שלושה מיליארד פרמטרים פעילים?

לא. מודל מומחים דורש שכל המשקלים, שתופסים 56.9 GB, ישבו בזיכרון של כרטיס המסך במלואם. החיסכון מתבטא במהירות החישוב בכל צעד, לא בנפח הזיכרון שנחוץ להחזקת המודל.

איך המודל מתמודד עם עברית?

הכרטיס מגדיר תמיכה בשפה האנגלית בלבד, עם דגש על מבחנים באנגלית ובסינית. הוא לא אומן לחקירה או כתיבה בעברית ולכן לא מתאים למשימות מקומיות בשפה הזו.

איך מריצים

כדי להריץ אותו דרך ספריית transformers צריך לקחת בחשבון את נפח הקבצים, שעומד על 56.9 GB ומחולק לעשרים ושבעה קבצים בדיוק bfloat16. מכיוון שמדובר בארכיטקטורת מומחים, כל המשקלים חייבים לשבת בזיכרון של כרטיסי המסך גם אם רק חלק קטן מהם פעיל בכל רגע נתון. צריך חומרה ייעודית עם מספיק זיכרון וידאו כדי להחזיק את כל הנפח הזה, במיוחד אם רוצים לנצל את חלון ההקשר המלא שמגיע ל־131,072 טוקנים.

אם אין לכם שרת עם קיבולת כזו, שווה לבדוק ספקי ענן שמאפשרים קריאות API ישירות במקום לנסות לדחוס אותו מקומית. עליבאבא מספקים סקריפטים ייעודיים להרצה בגיטהאב שלהם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Alibaba-NLP/Tongyi-DeepResearch-30B-A3B")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0, וזה אומר חופש פעולה כמעט מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים בלי לחשוף קוד מקור, כל עוד שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗