GPT
D

DeepPlanning

קוד פתוח

Qwenapache-2.02026-01-13

  • planning
  • llm-benchmark
  • reasoning
  • autonomous-agents

יש כאן גם סקירה על Qwen עצמו.

המאגר מרכז משימות תכנון מורכבות לסוכני בינה מלאכותית, שדורשות אופטימיזציה תחת מגבלות תקציב וזמן. הוא מתאים למי שרוצה לבחון יכולת קבלת החלטות ארוכת טווח שלא נשענת על היגיון פשוט בלבד.

  • 751הורדות בחודש
  • 212לייקים

מה זה

המאגר כולל בין אלף לעשרת אלפים רשומות שמתמקדות בשני תחומים מעשיים: תכנון טיולים רב-יומיים וקניות מרובות מוצרים. בתרחישי הנסיעות, המודל נדרש לתאם לוחות זמנים, מיקומים ומסגרות תקציב הדוקות. בתרחישי הקניות, האתגר בנוי סביב בעיות אופטימיזציה קומבינטורית, שבהן יש לאתר מוצרים מתאימים תוך ניצול מקסימלי של הנחות ומבצעים.

המבנה הפנימי מחולק לקבצי ארכיון נפרדים לפי שפות, אנגלית וסינית, וכן לפי רמות קושי שונות שמסומנות כרמות אחת עד שלוש. כל רשומה דורשת שילוב של שלושה רכיבים: איסוף מידע אקטיבי דרך קריאות לפונקציות וגילוי מצבי סביבה נסתרים, עמידה בתנאים מקומיים ברמת הצעד הבודד, ושמירה על גבולות גלובליים כמו תקרת תקציב או עמידה בימי החופשה.

הכרטיס שפורסם אינו מפרט את מקורות הנתונים הגולמיים, את שיטות הניקוי או את אופן הסינון של הרשומות מתוך קבוצה גדולה יותר. הוא מציג את התוצר כמבחן ביצועים להערכת סוכנים, ומפנה למאמר המחקרי ולעמוד הפרויקט לצורך קריאה מעמיקה יותר על התהליך שבוצע.

מתאים ל

  • הערכת סוכני תכנון

    בדיקת יכולת המודל לבצע אופטימיזציה מורכבת תחת אילוצי תקציב וזמן אמיתיים לאורך מספר ימים.

  • אימון לקריאות ממשק

    כוונון מודלים לביצוע תשאול אקטיבי של נתונים דרך ממשקים חיצוניים כדי לגלות תנאים נסתרים.

  • פתרון בעיות קומבינטוריות

    בחינת אלגוריתמים לבחירת מוצרים והרכבת עגלות קנייה עם מקסום הנחות תחת תנאי סף.

איפה זה נופל

הנתונים מוגבלים לשתי שפות בלבד, אנגלית וסינית, ולכן אין כאן תמיכה בעברית או בהקשרים מקומיים של השוק הישראלי. בנוסף, המאגר מתמקד אך ורק בשני תרחישים ספציפיים של נסיעות ורכישת מוצרים. אם המוצר שלכם עוסק בתכנון משימות תעשייתיות או תהליכים פנים-ארגוניים, המגבלות והאופטימיזציות כאן לא ייצגו את הצרכים שלכם באופן מלא.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון apache-2.0 מתיר שימוש מסחרי מלא, כולל אימון מודלים והערכת ביצועים בתוך מערכות עסקיות. החובה היחידה היא לשמור על הצהרת זכויות היוצרים והייחוס למחברים המקוריים.

האם יש במאגר תמיכה בשפה העברית?

לא, המאגר כולל אך ורק נתונים באנגלית ובסינית, כפי שמופיע בקובצי הארכיון database_en ו־database_zh. בדיקות על משימות בעברית ידרשו תרגום והתאמה של בסיס הנתונים וממשקי השאילתות.

איך בנוי המאגר מבחינת קבצים?

המאגר מורכב משבעה קבצים ואינו מגיע כקובץ נתונים אחיד. הוא כולל ארכיונים דחוסים המחולקים לפי שפות וכן לפי שלוש רמות קושי שונות, שאותם צריך לחלץ כדי לגשת לסביבות הבדיקה.

במה הוא שונה ממאגרי הערכה רגילים לסוכנים?

בניגוד למבחנים שבודקים רק את הצעד הבא, כאן הדגש הוא על שמירה על מסגרת כוללת לאורך זמן. המודל נמדד ביכולת להגיע לפתרון שעומד במגבלות תקציב וזמן מחמירות ולא רק בתשובה נקודתית.

איך טוענים

המאגר פתוח לציבור ואינו דורש אישור גישה מראש. ההורדה כוללת שבעה קבצים, וביניהם ארכיונים דחוסים בפורמטים של zip ושל tar.gz המחולקים לפי שפה ולפי דרגות קושי שונות. לפני הטעינה בקוד, תצטרכו לפתוח את הארכיונים הרלוונטיים עבורכם, למשל קובצי השפה האנגלית או רמות הקושי הספציפיות שבהן תרצו לבחון את המערכת. המבנה אינו מוגש כקובץ טבלאי יחיד אלא כאוסף בסיסי נתונים וסביבות שמיועדות לאינטראקציה, ולכן יש לחבר את הסוכן שלכם לממשקי השאילתות שמייצגים את הסביבה בכל משימה.

from datasets import load_dataset

ds = load_dataset("Qwen/DeepPlanning")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת שלהם. הוא דורש מתן ייחוס ליוצרים ושמירה על תנאי הרישיון המקוריים. אין דרישה לשתף תוצרים או מודלים שתאמנו תחת אותו הרישיון, מה שמאפשר להשתמש בו בסביבה עסקית סגורה בלי לחשוף קוד פנימי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗