סורקות ומשמידות: חברות AI רוכשות מיליוני ספרים כדי לאמן מודלים

המרוץ לפיתוח מודלי AI מתקדמים וחכמים יוצר ביקוש עצום למידע איכותי וייחודי, וכעת נראה שחברות AI מצאו מקור חדש ובלתי צפוי לאימון המודלים שלהן. לפי תחקיר שהתפרסם ב- 404 Media, חברות צד שלישי רוכשות עבור חברות ה- AI כמויות גדולות של ספרים משומשים, כדי שיוכלו לסרוק את תוכנם ולהפוך אותו לחלק ממאגרי המידע המשמשים לאימון המודלים שלהן.

אחת הסיבות למהלך היא העלייה החדה בכמות התוכן שנוצר באמצעות AI ומציף את האינטרנט. תוכן זה, המכונה לעיתים 'זבל של בינה מלאכותית' (AI Slop), נחשב במקרים רבים לתוכן באיכות נמוכה ופחות אמין. לכן, ספרים שנכתבו ונערכו בידי בני אדם, במיוחד כאלה שפורסמו לפני השתלטות הצ'אטבוטים, הפכו למקור מידע אטרקטיבי עבור חברות המנסות לשפר את המודלים שלהן.

 

החברות שומרות על מסתורין

לפי 404 Media, חברת ISBNdb, שמחזיקה במאגר הכולל יותר מ- 111 מיליון ספרים מתועדים, החלה להציע שירותי רכישה בכמויות גדולות עבור חברות AI. היקף העסקאות נע בין אלפי עותקים ועד למיליון ספרים בהזמנה אחת.

חנויות ואנשים פרטיים שמוכרים את הספרים לאותן חברות סיפרו על זינוק משמעותי במכירות, אך ציינו כי הם לא יודעים למי מכרו אותם. מה שעורר את חשדם של מוכרי הספרים היה דפוס הרכישות החריג: הקונים התעניינו רק בספרים בעלי מספר ISBN, לא הפגינו העדפה לנושא או למחבר מסוים, ולעיתים אף התעלמו לחלוטין ממחיר הספר.

חלק מהספרים עוברים תהליך המכונה 'סריקה הרסנית', שבמסגרתו מפרקים את הכריכה, חותכים את דפי הספר ומעבירים אותם דרך סורקים תעשייתיים מהירים. אמנם מדובר בתהליך זול ויעיל יותר בהשוואה לתהליך שבו שומרים על הספר בשלמותו, אך הבעיה היא שבסופו העותקים הפיזיים מושמדים ואינם נשמרים.

תהליך כזה כבר נקשר בעבר לאנתרופיק (Anthropic), שפיתחה את המודל קלוד (Claude). במסגרת הליך משפטי שנוהל נגד החברה נחשף כי היא השתמשה בחברות סריקה חיצוניות לצורך דיגיטציה של ספרים מודפסים. במקביל, החברה הגיעה להסדר בהיקף של 1.5 מיליארד דולר בעקבות החזקת מאגר של מיליוני ספרים פיראטיים, אף שבית המשפט קבע כי עצם השימוש בספרים לצורך אימון מודלי AI עשוי להיחשב כשימוש הוגן.

מעבר לשאלות המשפטיות, המהלך מעורר גם דיון אתי: האם ספרים נדירים או כאלה שכבר לא מודפסים עוברים תהליך סינון לפני ההשמדה ? ומה קורה למידע לאחר שהוא נכנס למאגר פרטי שאינו נגיש לציבור ? ככל שהצורך במידע איכותי לאימון מודלי AI גדל, כך גם גדל הצורך של חברות הטכנולוגיה במקורות חדשים, וכעת הן החליטו לרתום למשימה גם את הספרים המודפסים.

אולי יעניין אותך גם

 
דילוג לתוכן