GPT
M

MiroThinker-v1.0-72B

קוד פתוח

miromind-aimit2025-11-13

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • agent

סוכן מחקר בקוד פתוח שמבוסס על Qwen2.5 בנפח 72B, אשר מאומן לבצע שרשראות ארוכות של מאות קריאות לכלים חיצוניים כדי לאמת עובדות ולתקן טעויות תוך כדי ריצה.

  • 73Bפרמטרים
  • 262,144טוקנים בהקשר
  • 135 GBמשקל הקבצים
  • 247הורדות בחודש

מה זה

המודל הזה לוקח את משקלי הבסיס של Qwen2.5-72B-Instruct ומכוון אותם סביב רעיון שהיוצרים מכנים Interactive Scaling. במקום לפלוט תשובה מהירה או להסתפק בשתיים שלוש בדיקות ברשת, הוא אומן באמצעות למידת חיזוק לחקור, להצליב מקורות ולבצע עד 600 קריאות לכלים שונים לאורך המשימה. השילוב בין חלון הקשר של 256K לבין החיבור לכלים מאפשר לו לנהל תהליכי מחקר עמוקים מאוד.

במדדי ביצועים הוא מציג תוצאות מעניינות, כולל 81.9% ב־GAIA-Text-103 ו־37.7% ב־HLE-Text. המשמעות בשטח היא יכולת עבודה רציפה ועצמאית מול סביבות מורכבות, ברמה שמתקרבת לביצועים של מערכות קנייניות סגורות, כל עוד מאפשרים לו לתשאל כלים חיצוניים שוב ושוב בלי לעצור אותו מוקדם מדי.

מתאים ל

  • סוכן מחקר אוטונומי

    הוא מסוגל לבצע מאות שאילתות וקריאות לכלים כדי לאסוף מידע ולהצליב מקורות ארוכים באנגלית.

  • פתרון בעיות רב שלביות

    מתאים למשימות ניתוח מורכבות שמחייבות פירוק לשלבים, אימות תוצאות ביניים ותיקון טעויות בזמן אמת.

  • עיבוד מסמכי ענק

    חלון הקשר של 256K מאפשר לטעון דוחות שלמים ולשלב קריאות לכלים כדי לשלוף נתונים מדויקים.

איפה זה נופל

המודל הזה תלוי לחלוטין בסביבת כלים מתפקדת. אם מנתקים אותו מחיפוש או מסביבת ריצה, מאבדים את היתרון המרכזי שלו, שכן כל האימון נשען על אינטראקציה חוזרת עם המערכת. בנוסף, הוא אומן סביב שפה אנגלית בלבד, כך שלא הייתי בונה עליו לחילוץ מידע או מחקר במקורות בעברית. ריצה של מאות קריאות לכלים לכל שאלה מייצרת גם זמני תגובה איטיים מאוד, שלא יתאימו למוצר שדורש מענה מיידי למשתמש קצה.

אותה משפחה

MiroThinker יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יתפקד טוב כצ'אטבוט רגיל לשירות לקוחות?

לא, הוא לא נועד לזה. האימון שלו מכוון לחקירה עמוקה ולביצוע רצף ארוך של קריאות לכלים חיצוניים, מה שיוצר השהיה ארוכה ותקורה כבדה שלא מתאימות לשיחה מהירה.

איך מיישמים את קריאות הכלים מולו?

היוצרים בנו את המערכת סביב פורמט מוגדר של XML שעוטף אובייקטי JSON לתיאור הכלים. כדי לקבל את הביצועים המדווחים צריך להיצמד בדיוק למבנה ה־system prompt שהם מפרסמים בריפו.

איך מריצים

כדי להרים 72 מיליארד פרמטרים בדיוק bfloat16 מלא צריך לפחות שני כרטיסי H100 או ארבעה כרטיסי A100 של 80GB, רק כדי לטעון את 135 הג'יגה של המשקלים ולהחזיק זיכרון עבודה לחלון הקשר ארוך. היוצרים ממליצים להרים שרת באמצעות SGLang עם פרמטרים ספציפיים: טמפרטורה 1.0, ערך top_p של 0.95, ו־repetition penalty של 1.05.

אם אין לכם קלאסטר כזה בחצר או בענן פרטי, זה מודל יקר מאוד לתחזוקה שוטפת. במקרה כזה עדיף לבדוק את הגרסאות הקטנות יותר של אותה משפחה, 8B או 30B, או לצרוך את היכולת דרך נקודת קצה מרוחקת שתחויב לפי שעות עבודה או שימוש בפועל.

from transformers import pipeline

pipe = pipeline("text-generation", model="miromind-ai/MiroThinker-v1.0-72B")
print(pipe("שלום"))

הקבצים

47 קבצים במאגר, 135 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט משוחרר ברישיון MIT מלא. אתם רשאים לקחת את המשקלים, לשנות אותם, להטמיע אותם במוצר מסחרי סגור, או להריץ אותם כחלק משירות בתשלום, בלי לשלם תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית והרישיון בקבצי ההפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗