GPT
N

Nemotron-Orchestrator-8B

קוד פתוח

nvidiaרישיון לא דווח2025-11-25

  • transformers
  • safetensors
  • qwen3
  • text-generation
  • conversational

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

המודל הזה לא מנסה לדעת הכל בעצמו, אלא מנהל ומפעיל מודלים וכלים אחרים. הוא מתאים למי שרוצה ביצועים של מודלי ענק בלי לשלם את העלויות שלהם.

  • 8.2Bפרמטרים
  • 40,960טוקנים בהקשר
  • 30.5 GBמשקל הקבצים
  • 3,372הורדות בחודש

מה זה

אנבידיה ואוניברסיטת הונג קונג לקחו את Qwen3-8B ואימנו אותו במיוחד לתפקיד מנצח תזמורת. במקום לפתור שאלות מורכבות מקצה לקצה, הוא מקבל משימה ומחליט מתי לקרוא לחיפוש, מתי להריץ קוד ומתי להפעיל מודלי שפה אחרים. האימון התבסס על אלגוריתם GRPO עם פונקציית תגמול שמאזנת בין דיוק, זמן ריצה, עלויות כספיות והעדפות משתמש.

במבחן Humanity's Last Exam המודל הגיע לתוצאה של 37.1 אחוזים ועקף את GPT-5 שעמד על 35.1 אחוזים, כשהוא עושה את זה במהירות גבוהה פי 2.5 ובשלושים אחוז מהעלות הכספית. בנוסף הוא נבדק על FRAMES ועל Tau2-Bench מול מודלים כמו Claude Opus 4.1 וגרסת Qwen3 של 235 מיליארד פרמטרים, והציג יכולת טובה לתמרן בין כלים בלי להסתבך.

מתאים ל

  • סוכן ניתוב משימות

    ניתוב שאילתות מורכבות לכלי רשת, מנועי קוד או מודלים חיצוניים בעלות נמוכה.

  • אופטימיזציית עלויות API

    קבלת החלטות מתי להפעיל מודל ענק יקר ומתי להסתפק בכלי פשוט וזול.

  • מחקר על מערכות מרובות כלים

    בדיקת אלגוריתמי תזמור ואימון סוכנים בסביבות מורכבות לפי שיטת ToolOrchestra.

איפה זה נופל

הכרטיס מגדיר אותו במפורש למחקר ופיתוח בלבד, כך שהוא לא מיועד למערכות ייצור חיות. מעבר לזה, המודל אומן רק באנגלית ואין עליו מידע לגבי עברית, שסביר להניח שלא תעבוד טוב. הוא גם תלוי לחלוטין באמינות הכלים שמחברים אליו, ואם כלי מחזיר שגיאה או מתעכב, כל שרשרת ההחלטות עלולה להיפגע.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כמודל צ'אט רגיל?

טכנית כן, אבל אין סיבה לעשות את זה. הבסיס שלו הוא מודל 8B רגיל, וכל היתרון שלו מגיע מהאימון הייעודי לחלוקת עבודה והפעלת כלים חיצוניים. כמודל שיחה עצמאי תקבלו תוצאות פושרות בהרבה.

האם הוא יכול לעבוד עם מערכות וכלים בעברית?

הכרטיס מצהיר על תמיכה באנגלית בלבד. אם תתנו לו הוראות בעברית או כלים שמחזירים פלט מקומי, הדיוק שלו בתזמור ובהבנת המשימה כנראה יירד משמעותית.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־30.5 ג'יגה בייט בפורמט bfloat16. כדי לטעון אותו כמו שהוא תצטרכו כרטיס מסך עם לפחות 24 ג'יגה זיכרון, ורצוי יותר אם אתם מתכננים לנצל את חלון ההקשר המלא שמגיע ל־40,960 טוקנים. הוא נתמך ישירות בספריית transformers הרגילה.

צריך לקחת בחשבון שלהריץ אותו לבד זה רק חצי מהעבודה. המודל הזה תלוי בכלים ומודלים נוספים שהוא אמור להפעיל, ולכן תצטרכו להקים סביבו את כל התשתית של הרצת קוד, מנועי חיפוש וחיבורי API חיצוניים כדי לקבל ממנו ערך אמיתי.

from transformers import pipeline

pipe = pipeline("text-generation", model="nvidia/Nemotron-Orchestrator-8B")
print(pipe("שלום"))

הרישיון

הרישיון הרשמי לא דווח במטא־דאטה של הדף, אך בטקסט עצמו מופיעה הפניה לרישיון של אנבידיה ונכתב בבירור שהוא מיועד למחקר ופיתוח בלבד. המשמעות פשוטה, אסור לשלב אותו כרגע במוצר מסחרי או להפיץ אותו ללקוחות כחלק משירות בתשלום.

הרישיון המלא בעמוד המודל ↗