GPT
P

product-database

קוד פתוח

openfoodfactsagpl-3.0,odbl2024-10-21

מאגר נתוני מזון וקוסמטיקה שמכיל מעל מיליון מוצרים עם רכיבים וערכים תזונתיים. הוא מתאים למי שבונה מודלים לתזונה או מנועי זיהוי לתוויות על בסיס מידע שנסרק מהשטח.

  • 19,691הורדות בחודש
  • 142לייקים

מה זה

המאגר מרכז רשומות מפורטות על מוצרי צריכה מכל העולם, כולל רשימות רכיבים, אלרגנים וערכים תזונתיים כפי שהם מופיעים על האריזות. הנתונים מגיעים מפעילות שיתופית של עמותה ללא כוונת רווח, שבה יותר מ־25,000 מתנדבים סרקו ברקודים והעלו תמונות של תוויות באמצעות אפליקציה ייעודית ב־150 מדינות שונות.

המקור מבוסס על קובץ JSONL יומי שהעמותה מפיצה, אבל כאן עיבדו אותו ישירות לפורמט Parquet בעזרת ספריית Pyarrow כדי שיהיה קל יותר לעבוד איתו. המאגר מכיל ארבעה קבצים, כשהחלוקה המרכזית מתבצעת בין מוצרי מזון בקובץ food.parquet לבין מוצרי טיפוח בקובץ beauty.parquet.

במהלך העיבוד נוקו שדות טכניים שונים. המפתחים הסירו תגיות דיבאג, הורידו תגיות היררכיה ושדות שפת ממשק, אך שמרו את תגיות הנתונים הכלליות שמחזיקות את רוב המידע. בנוסף, טקסט הרכיבים שמופיע בשפות שונות נשמר ומפוצל לעמודות נפרדות עבור כל שפה שזוהתה במוצר.

מתאים ל

  • זיהוי רכיבים מתמונה

    אימון מודלים לחילוץ וסיווג רכיבים ואלרגנים מתוך תמונות של תוויות מזון.

  • ניתוח ערכים תזונתיים

    בניית מנועי השוואה בין מוצרי צריכה שונים לפי כמות סוכר, שומן וקלוריות.

  • סיווג מוצרי קוסמטיקה

    ניתוח מרכיבים בקובץ הטיפוח כדי לאתר חומרים פעילים במוצרים שונים.

איפה זה נופל

המידע מבוסס כולו על הזנות של מתנדבים מאפליקציות טלפון, מה שיוצר פערים באמינות ואיכות הנתונים. רשימת השפות הנתמכות כוללת שתים עשרה שפות אירופיות בעיקר, ללא עברית, כך שאי אפשר להסתמך עליו לניתוח טקסט של תוויות ישראליות מקומיות. הנתונים לא עברו סינון ידני של תזונאים, וכל מוצר נשען על איכות הצילום וההקלדה של מי שהעלה אותו.

שאלות
נפוצות

האם המאגר כולל מוצרים שנמכרים בישראל ובעברית?

עברית אינה מופיעה ברשימת השפות הרשמית של המאגר, שכוללת שתים עשרה שפות אירופיות בלבד. ייתכן שמוצרים מישראל נסרקו באנגלית, אך המאגר לא מתאים למשימות עיבוד שפה טבעית בעברית.

האם מותר להשתמש במידע הזה במוצר מסחרי?

הרישיונות ODbL ו־AGPL-3.0 מתירים שימוש מסחרי, אך כוללים דרישת Share-Alike מחמירה. אם אתם מעבדים, מרחיבים או מפיצים גרסה של הדאטה, עליכם לשחרר אותה תחת אותם תנאי רישיון פתוחים.

איך הנתונים נאספו בפועל?

יותר מ־25,000 מתנדבים השתמשו באפליקציות מובייל כדי לסרוק ברקודים ולהעלות תמונות של מוצרים ב־150 מדינות. המידע הומר לאחר מכן לקובץ Parquet מנוקה מתגיות עודפות.

איך טוענים

טוענים את הנתונים ישירות מקובצי ה־Parquet, למשל באמצעות Pandas או Pyarrow, בלי שום צורך לבקש אישור גישה מראש. המאגר פתוח לחלוטין להורדה ומכיל בין מיליון לעשרה מיליון רשומות שמחולקות בין מזון לקוסמטיקה. לפני שמתחילים לעבוד, קחו בחשבון שמדובר בעיבוד של קובץ מקור כבד מאוד, כך שכדאי לטעון רק את העמודות הדרושות לכם. השדות המרכזיים שתרצו לבדוק הם תגיות המידע הכלליות וטקסט הרכיבים שמפוצל לפי שפות, לצד נתוני האלרגנים והערכים התזונתיים של כל פריט.

from datasets import load_dataset

ds = load_dataset("openfoodfacts/product-database")

הרישיון

המאגר מוגדר תחת שילוב של רישיונות AGPL-3.0 ו־ODbL, והנתונים הבודדים תחת רישיון ODC-DbCL. המשמעות היא שאתם רשאים לעשות שימוש מסחרי במידע, אך חלה חובת ייחוס ברורה, וכל שינוי או שיפור של מאגר הנתונים מחייב שיתוף תחת אותו הרישיון בדיוק. אם תאמנו מודל ישירות על בסיס הנתונים הזה, תצטרכו לבחון משפטית אם תוצרי המודל נחשבים יצירה נגזרת הכפופה לחובת השיתוף הפתוח.

הרישיון המלא ב־Hugging Face ↗