GPT
P

pi05_base

קוד פתוח

lerobotgemma2025-09-09

  • lerobot
  • safetensors
  • vision-language-action
  • imitation-learning
  • robotics

בסיס לרובוטיקה שמתרגם תמונות מכמה מצלמות והוראות טקסט לפעולות פיזיות רציפות. הוא מיועד למי שרוצה לאמן מדיניות תנועה לזרוע רובוטית בלי להתחיל מאיפוס מוחלט.

  • 3.6Bפרמטרים
  • 13.5 GBמשקל הקבצים
  • 21,332הורדות בחודש
  • 102לייקים

מה זה

מדובר במודל ראייה, שפה ופעולה (VLA) שמחבר בין קלט ויזואלי של מספר מצלמות, נתוני מצב פיזי של הרובוט, והוראה מילולית באנגלית, כדי לייצר וקטור תנועה רציף. הוא אומן מראש על מאגרי הדגמות רובוטיות לצד דאטה מולטימודלי רחב, במטרה להכליל למשימות ארוכות טווח בסביבות חדשות.

במקום לנחש טוקנים בדידים כמו מודלי שפה רגילים, הוא מייצר פעולות ישירות במרחב רציף בעזרת flow-matching. הוא מוגדר כמודל בסיס, כלומר המטרה שלו היא לשמש נקודת מוצא לכיול עדין על המשימה והחומרה הספציפיות שלכם, ולא לפעול ישר מהקופסה על כל זרוע בלי אימון נוסף.

מתאים ל

  • אימון זרוע רובוטית למשימה

    כיול עדין על הדגמות אחיזה והזזה, כשרוצים לנצל ידע קודם על עצמים בעולם.

  • מחקר בתפיסה ופעולה

    בדיקת שיטות flow-matching על קלט ממספר מצלמות במקביל בסביבת מעבדה.

  • אינטגרציה עם חומרת lerobot

    הרצה ישירה על פלטפורמות נתמכות כמו so100 כדי להעריך מדיניות תנועה פיזית.

איפה זה נופל

זה לא המודל המלא מהמאמר המקורי. חסרים בו רכיבים קריטיים כמו חיזוי תתי-משימות, טוקניזציה של פעולות או למידת חיזוק, שלא שוחררו החוצה. כרגע הוא תומך אך ורק בראש הפעולה של flow-matching.

בנוסף, הטקסט מוגבל לאנגלית, והמודל לא יעשה שום דבר שימושי בלי שתאספו קודם דאטהסט הדגמות ותעשו לו fine-tuning מותאם בדיוק למצלמות, לזוויות ולסוג הזרוע שחיברתם.

שאלות
נפוצות

האם אפשר להפעיל אותו ישר על רובוט בלי לאמן?

לא. הכרטיס מציין במפורש שמדובר במודל בסיס שנועד לאימון נוסף (fine-tune) על המקרה שלכם. בלי ללמד אותו את הזרוע ואת סוג המשימה הספציפי, הוא לא יבצע פעולות מועילות.

האם הוא מבין פקודות בעברית?

לא, המודל אומן ותומך באנגלית בלבד. אם תרצו לשלוט בו בהוראות שפה, תצטרכו להזין לו טקסט באנגלית או לתרגם את הפקודות בדרך.

איזה קלט המודל דורש בזמן ריצה?

הוא מצפה לקבל תמונות ממספר זוויות צילום, את מצב המפרקים של הרובוט, והוראת טקסט אופציונלית באנגלית. מכל אלה הוא מייצר את הפקודה המוטורית הבאה ברצף.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־13.5 גיגה-בייט עם 3.6 מיליארד פרמטרים, מה שמחייב כרטיס מסך מודרני עם זיכרון וידאו ייעודי של 16 עד 24 גיגה לפחות עבור הסקה. לאימון מלא תצטרכו כרטיס חזק משמעותית או שימוש ב־bfloat16 וב־gradient checkpointing כדי לא לחנוק את הזיכרון.

ההתקנה רצה דרך ספריית lerobot מגיטהאב יחד עם התוסף של pi, ומתחברת ישירות להתקני וידאו וזרועות דרך סקריפטים מובנים כמו lerobot-record. אין פה אפשרות לקרוא לשירות ענן מוכן כי כל הרעיון הוא חוג בקרה פיזי שמגיב בזמן אמת לחומרה המקומית שלכם.

pip install -U huggingface_hub
hf download lerobot/pi05_base

הקבצים

7 קבצים במאגר, 13.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא gemma. המשמעות היא שיש מגבלות שימוש של גוגל, כולל איסור על שימושים מסוכנים מסוימים ותנאי הפצה ספציפיים. חובה לקרוא את תנאי רישיון ג׳מה לפני שמשלבים את המודל במוצר מסחרי או מפיצים חומרה שמריצה אותו.

  • שימוש מסחרי
  • שינוי הקוד
  • כפוף לתנאי השימוש של Google

הרישיון המלא בעמוד המודל ↗