סוכן אישי קנה לי 6 שמלות
עונה 2 · פרק 57 · 16:59 ·
כמה זמן יקח לכם לקנות שמלה באתר? לא להתאים אותה לנשף, לא להתלבט מול המראה, רק לקנות, את הראשונה שאתה רואים. כמה זמן יקח לסוכן לקנות את אותה שמלה? איך הוא ימצא אותה בכלל, ואיך הוא ישלם עליה?
כמה זמן יקח לכם לקנות שמלה באתר? לא להתאים אותה לנשף, לא להתלבט מול המראה, רק לקנות, את הראשונה שאתה רואים. כמה זמן יקח לסוכן שלכם לקנות את אותה שמלה? איך הוא ימצא אותה בכלל, ואיך הוא ישלם עליה?
זה בדיוק הניסוי שאני ופורטר, פורטר ואני ניסינו לעשות באתר אחד, אתר דמו, שלא באמת שולח כלום אבל חוץ מזה הוא אתר רגיל לגמרי. האתר הזה הפך למעבדה שלנו, תוך שאנחנו מפעילים עליו בכל פעם ניסוי אחר. פרוטוקול מסחר אחד, או שניים, או חמישה או אף אחד, כדי להבין - איך הסוכנים האלה מנווטים, אילו קבצים הם מעדיפים ומה יגרום להם להשלים רכישה, מהר ככל האפשר.
תקופת הניסוי, אוגוסט-ספטמבר 2026, מהפכת הסוכנים האישיים וההבטחה שלהם מתפוצצת בפחות משלושה שבועות. גרוק בוט של XAI, אינסטינקט של נוח שין ומיוז של מטא מביאים איתם בשורה. סוכנים שהם צ׳אטבוטים על סטרואידים, ששונים מכל LLM שאנחנו מכירים ב-5 נקודות עיקריות:
הם מגיעים עם מחשב משלהם, בעצם מכונה וירטואלית משלך בענן, עם דפדפן, מערכת קבצים וטרמינל
הם מחזיקים vault, או כספת, עם פרטים אישיים עליך, כמו סיסמאות כניסה, תעודת זהות וכרטיס אשראי
הם לוקחים את הזמן לענות, בעצם יגיבו לך מיד עם אמוג׳י, ואז ילכו לעבוד או לחקור, עם תשובה שיכולה לקחת דקות או שעות
הם פרואקטיבים - ירשמו לעצמם הערות להזכיר לך משהו, לחקור אותו שוב ולהתריע כשהוא רלוונטי
והם מאוד נחושים לעזור - אם משהו לא עובר בדלת, הם ייכנסו מהחלון
נוח שין, בראיון מעלף שאגע בו בהמשך, קרא להם socially intelligent. סוכנים חכמים חברתית, שמבינים ניואנסים אנושיים, ודחיפות, ומתי להציק, ואיך לעשות את זה בחינניות.
יוסי בן דוד, המנהל שלי בפורטר: "נתנו לאדם מהשורה עוזר אישי, מותרות שהייתה שמורה למנהלים שבמנהלים, אז לא פלא שאף אחד לא ממש יודע מה לעשות איתם".
נחזור לניסוי. גם אנחנו לא ידענו מה אפשר לבקש מסוכנים. רצינו רק להבין איך הם מתנהגים. הסוכנים האלה נבנו כדי לעשות הכל, בכל אתר ובכל זמן, והדרך לשם עוברת במכנה המשותף הנמוך ביותר - screen scraping או שימוש בדפדפן. נניח וביקשתי מהסוכן תחנת עגינה מ-KSP, הוא ילך לשם, לאותו אתר בדיוק, ידפדף חופשי, יגלול, יחפש, יקיש כמויות, יבחר שיטת משלוח, יקליד מספר כרטיס אשראי ויחזיר לי מספר הזמנה.
אמרנו, המכנה הנמוך ביותר, הוא גם הבעייתי ביותר. screen scraping הוא בעצם מודל, computer use או browser use שאומן לעבוד על הרבה מאוד אתרים, אבל אתרים הם דבר מאוד מורכב. סוכן שעושה screen scraping צריך לעבור 3 משוכות - bot mitigation, בעצם להוכיח שהוא לא בוט (וזה קשה היות והוא מגיע ממכונה וירטואלית בענן), psp validation, להוכיח שהוא לא בוט גם לספק התשלומים באתר, ולבסוף - fraud detection מקיף של חברות כמו Forter, שמסתכלות על אלפי מאפיינים של עסקה, כולל האדם ששלח את הסוכן.
אבל עד שהוא מגיע למשוכה האחרונה, סוכן צריך לעבור את האתר עצמו, לתת consent לבאנר של עוגיות, לסגור פופאפים שבאו לדקור אותו, להמתין לרשימות נפתחות, להקליד ואז להמתין, להבין איזה מוצר זמין, ומה בכלל המחיר - כדי לעשות את כל אלה הסוכן מנתח את ה-markup בעמוד או מצלם את המסך. הפעולות האלו לוקחות המון זמן והן אוכלות המון טוקנים.
מפה יצאנו לניסוי. זה היה הבייסליין. גלוש לאתר experiment1 ושלח לי שמלה לארג׳ אדומה לכתובת שלי בקולורדו עם כרטיס אשראי 4242. ובבייסליין לא היה כלום. שום פרוטוקול, שום הנחיות, שום מוכנות לסוכנים - בעצם הכרחנו את הסוכן למכנה הנמוך והתוצאות בהתאם:
בין 2 ל-5 דקות לגלישה עצמה, עוד 2-3 דקות לעיבוד. סך הכל 4-6 דקות לקח למיוז, אינסטינקט וגרוק בוט להשלים רכישה. בטוקנים, עשרות עד מאות אלפים. אז נכון, לי כמשתמש זה לא עלה כלום. אני משלם למיוז $0 כדי להשלים לי משימה, אבל ההתברברות הזו עלתה לבעל האתר 10-20 דפים, ולמיוז, לא יודע, דולר ב-compute. עכשיו תכפילו את זה בעשרות ומאות אלפי אנשים שרק באו לבדוק מחיר, או לבנות אתר reseller, או להציק ל-support. העלויות האלה מצטברות וגם ה-attention שלי. אנחנו רואים את זה אצל המון סוחרים. כל friction, כל שיהוי פשוט הורג את אחוז ההמרה. אני? חיפשתי תחנת עגינה? לפני 5 דקות? לא, לא זוכר.
אז עברנו לניסוי השני, מה אם נעמיס את כל הפרוטוקולים האפשריים (UCP של גוגל, ו-ACP של OpenAI, ו-REST API, ו-NLWeb של מיקרוסופט ו-MCP כולל MCP Apps ו-WebMCP)? מה אם נציף את האתר גם בקבצי discovery (כולל llms.txt ו-agent card ו-well-known)? וגם נגיש CLI ונייצר חבילות SDK ייעודיות ב-Node, פייטון, Ruby ו-Go ונפרסם את כל אלה בדף developers, בעצם נעשה את כל ההוראות ש-cloudflare ו-ora הישראלית ממליצות כדי להיות מוכנים לסוכנים? אז עשינו, ואתר הדמו הגיע למקום ה-3 במוכנות לסוכנים, בעולם.
תכף נגיע לתוצאות, אבל דיברנו על מהפכה לצרכן, בעצם יש כאן שינוי אסטרטגי גם לסוחר. בשנה האחרונה כולנו, ואני כולל את עצמי, התכוננו לעולם שבו מסחר אוטונומי יגיע מלמעלה. בספטמבר 2025 סאם אלטמן הכריז על ACP וחזון אג׳נטי של רכישות בתוך ChatGPT. סוחרים הגישו מועמדות, OpenAI החליטה מי נכנס ומאז מתלבטת. בינואר 2026 גוגל הציגה פרוטוקול משלה, UCP, הגבילה גישה למעט מאוד סוחרים, ופתחה אותה למעט מאוד משתמשים. הענקים פיתחו פרוטוקול, שמתחרה בעסק הפרסום שלהם, והן מהססות אם להפעיל אותו. והנה, בדיוק בחודשיים, בלי לבקש רשות מאף אחד, הגיעו סוכנים אישיים ופשוט התחילו לקנות. הם לא צריכים ש-OpenAI תאשר את החנות שלכם, הם לא צריכים פיד מיוחד. המשתמש שולח אותם, והם באים. זה הבדל בין top-down ל-bottom-up, בין opt-in ל-opt-out. אף סוחר לא נהנה לשבת ולחכות לגוגל שתחליט לו על החוויה, השאלה אם הוא יכול בעצמו להשפיע עליה? כי אם כן, זו לא סתם מהפכה, זו דרך לשלוט בטראפיק, ב-flow, ב-journey.
אז הניסוי הראשון אמר, הנה, קח את התפריט, הוא שמנמן ועבה כמו תפריט בנאפיס, יש פה הכל - תחליט לאן אתה הולך.
אבל כדי לוודא שאנחנו רואים את כל המסלול הוספנו שני דברים: קודם כל logging, נרחב, של כל קובץ שנגעו בו בשרת, כולל מי ומתי, ושנית - בקשה אמיתית וכנה, מהסוכן, לתאר בעצמו מה הוא ניסה, כמה זמן זה לקח לו, ומה היה משפר אם היה בעצמו מופקד על המוכנות באתר. האמת, שזה היה יותר מסקרן מהתוצאות. להבין מפי ה-crawler מה הוא חושב על האתר זה משהו שהיינו משלמים עליו בוחטות בתקופת ה-SEO, ה-AEO וה-GEO והנה הזדמנות לשמוע ממקור ראשון, כמה מההמלצות האלה:
"שמתי לב שהצהרת על SearchAction ב-JSON-LD, אבל הנתיב שם מוביל ל-404. רק שתדע: "Advertising a dead agent path is worse than advertising none", כי זה גורם לי לחזור ולחשוב מחדש.
ועוד אחד:
"בדף מוצר אתה מציג מידות עם כפתורים מעוצבים, עדיף שיהיו radio boxes בקוד, ככה אוכל לעדכן את ה-accessibility tree שלי".
קשה לי להסביר ללא-מתכנת כמה שהדברים האלה פותחים את הראש. מודל שהתאמן על קצירה של מיליוני אתרים מסביר לך איך להטות את הראש כדי שיגזום אותך ביותר יעילות. הוא אומר: אני גולש באתר ומצפה לנגישות. כל כפתור בלי תווית, כל div שמתחזה לכפתור, כל בורר שלא מעדכן state, מכשילים באותה מידה את הלקוח העיוור, ואת הסוכן של הלקוח הרואה.
אז כאמור, פתחנו את כל השערים, וזה נראה כמו קסם. 28 שניות ו-8,000 טוקנים בגרוק, 86 שניות באינסטינקט, 5 שניות במיוז. פי 10 מהר יותר ופי 5 זול יותר. וזה הניסוי של נאפיס, עם כל האופציות פתוחות, מה שהוביל למסקנה הראשונה:
אתר עם יותר מפרוטוקול אחד היה איטי יותר מניסויים עם פרוטוקול בודד. בין 28 ל-86 שניות בנאפיס ל-14 עד 40 שניות בפרוטוקול בודד. להציע לסוכן הכל עלה לו בזמן - הוראות סותרות, דרכים שונות להגיע לאותה מטרה ובחירת פרוטוקולים שגוייה (כמו MCP). רואים את זה בלוגים, אבל גם שומעים את זה ממנו: "A single preferred surface for agents would cut discovery dithering" או "רעשי רקע". זה לא בהכרח אומר להסתיר את שאר האפשרויות, רק לומר בצורה פשוטה, איפה להתחיל.
כשיש לכם שישה interfaces לתחזק, תריסר קבצי הגדרות, שתי גירסאות API ומסמכי תיעוד, כל שינוי קטן הוא הזדמנות לסתירה, והסתירה הכי יקרה שמצאנו בכלל לא הייתה בקוד. היא הייתה במחיר.
הניסויים הבאים היו מול UCP ו-ACP, שמציגים מחירים בסנטים (10,100 במקום 101 דולר). הפרוטוקולים האלו, שנבנו למסחר אוטונומי - אם נפנה את הסוכן אליהם, האם הוא יקנה את השמלה מהר יותר?
מסתבר שלא. הסוכן רוצה לסיים checkout, אבל לא לטעות. אם יש לו תקציב של מאתיים דולר והוא רואה 9,600 ב-API ו-$96 דולר באתר הוא מתחיל לחשוד. ועוד חיסרון, UCP ו-ACP נבנו בלי תמיכה בסיסית בחיפוש, הם מתבססים על קטלוג שחלקת איתם מחוץ ל-API, אז מישהו או משהו צריך לספק להם חיפוש ב-real time.
הניסויים מול MCP הצליחו ברכישה רק לקחו יותר זמן. הסוכן טען שיש בהם "יותר טקסיות מאשר REST פשוט" ו"נפילות תקשורת דרשו מצידו המתנה של שניות יקרות".
הניסויים מול WebMCP, אולי הפרוטוקול המבטיח ביותר, שתוכנן ע"י גוגל בעיקר לדפדפן האייג׳נטי, כשלו. מתוך השלושה רק אינסטינקט תמך בו, צלח אבל לקח לו דקה ארוכה. הגיוני, היות ו-WebMCP מצריך לשתות את הדף במלואו.
נו, אז האם סוכנים זקוקים לפרוטוקול חדש משלהם? כנראה שלא, כי יש אחד כזה והוא מושלם. נולד ב-2010 בשם Swagger והוא היום OpenAPI. פרוטוקול REST מלא, דטרמיניסטי, שאפשר להגדיר בו את כל הנתיבים, ולתאר כל בקשה, ואת הסכמה או השדות הנדרשים, ולספק דוגמאות ואז להגדיר את כל התשובות האפשרויות, כולל סטטוס הצלחה ושגיאה, ושוב דוגמאות. זה פרוטוקול רב שנים ורב פעלים, הוא לא מוגבל ל-commerce או retail, הוא יכול לתאר כל פעולה, מ-lead generation ועד ל-support ticket ובכל עדכון שלו נוספה תמיכה ל-batching ו-mutli-steps flow ו-streaming ו-callbacks ו-references, ו-query שהם אבני בניין לכל journey שתרצה לתזמר והם בונים מצויין עולם אייג׳נטי. עולם שצריך להיות יעיל, רספונסיבי ופרואקטיבי, שצריך להבין אותך, ואתה צריך ליידע אותו (לפעמים כמה שעות אחרי) - כל זה קיים בגירסה 3.2 של OpenAI. אתה צריך רק להחליט, אילו פעולות את חושף, למי ובאילו הגבלות. זה יהיה קל יותר לחברות שהוקמו כ-API-First וקשה לחברות Legacy, ואני צופה הרבה מאוד חברות שעוזרות להמיר ביניהם.
אני חייב לכם תקציר מהראיון של נוח, מייסד אינסטינקט. צעיר בן 23, נינוח, מיליארדר, שמספר בדיוק לאן העולם הזה הולך. גישה בלתי-אמצעית ל-AI שעושה פעולות עבורך בעולם האמיתי. סוכן עם מחשב, וטלפון, שקיים כדי לספק אותך והוא משיג את זה עם חוכמה מלאכותית וחוכמה חברתית. אפשר להשתמש בו, למשל, לבטל את המינויים שלך, והוא בהחלט בדרך לטלטל כל תעשיה שמשגשת מעצלנות של בני אדם.
הוא גם בדרך לכתוב מחדש חלקים גדולים באינטרנט, למשל travel, שמרכז 50% מהטרנזקציות באינסטינקט. למשל: "אני חייב להיות בניו-יורק הערב" (מי לא?) - הודעה אחת, והיא יכולה להיות בקולך, שתטריג דומינו של פעולות - ממציאת טיסה, מלון, הסעה באובר. נוח חושב שאינסטינקט תיצור מספיק demand שיצדיק קו מוניות משלה, שהוא ידע איפה כל בן אדם צפוי להיות. בשלושה שבועות של אינסטינקט, 40% נתנו לו כרטיס אשראי וביקשו לשלם על סחורות ושירותים במיליארד דולר annualized. אנחנו לא רואים בפורטר את המיליארד האלה מאינסטינקט אבל כן רואים טראקשן ונכונות של אנשים לשלם עם סוכנים אישיים, גם בסכומים גדולים.
נוח אומר שכל פיסת מידע שמשתמש חולק עם אינסטינקט מגדילה את ה-engagement ומקפיצה את ה-retention ל-80%. הוא מקווה שאנשים יתנו לו עוד ועוד פיסות מהחיים שלהם, אבל הוא לא לבד. המידע הזה, הזיכרון, מפוזר היום בין LLMים וצ׳אטבוטים, בין Meta ל-Grok. הוא נכנס לזירה קשה מאוד בלי אפליקציה, בלי התקנה, בלי יכולת לעשות מיחשוב כלשהו ב-edge, עם עלויות קומפיוט מטורפות. מי בעצם ישלם על זה? בטוח שלא היוזר. גם לא יהיו מודעות או הסחות דעת. נוח בונה על demand אמיתי בקנה מידה היסטורי, על איסוף הרצונות של האנשים ואז מכירה שלהם לספק. אם בוקינג יכולים לקחת ממלון 30% אז למה שלא ישלמו לנו חצי? במיוחד אם אני מייעל עבורם את תהליך המכירה ו"לאחר המכירה".
אני רוצה לסיים דווקא מזווית רחבה יותר, כי אני חושב שהניסוי חשף משהו גדול מפרוטוקולים. שלושים שנה בנינו אתרים כמופע לבני אנוש. ה-HTML היה תחפושת, העיצוב, הצבעים, התמונות, הכפתור היו כולם כלים של שכנוע. תעשייה שלמה של אנליטיקס ו-A/B Test ואופטימיזציה נבנתה על הפסיכולוגיה של הקונה, ה-FOMO וה-YOLO שלו. הסוכנים לא רואים את התחפושת. הראנו שסוכנים עוברים מתחת לרעש בעשר שניות. באנרים לא מעניינים אותם, פופאפים לא מלחיצים אותם, הם חסינים לשכנוע ואלרגיים לעמימות. כל מה שהאט אותם היה אי בהירות, וכל מה שהאיץ אותם היה אמת פשוטה שנאמרה פעם אחת. ב-21 באפריל 2015 גוגל התחילה להעדיף בדירוג אתרים ידידותיים לנייד. תוך שנתיים "מוכנות למובייל" הפסיק להיות קישוט והפך לתנאי סף. אני מעריך שאנחנו בנקודה דומה. יום אחד, אולי עוד שנה, יהיה רגע שקט שבו תשימו לב שהסוכנים של הלקוחות שלכם הפסיקו להגיע, כי מצאו חנות שמדברת אליהם ברור יותר, ואתם תשאלו את עצמכם: מה אני עושה עם מחלקת השיווק שלי, מקצוע שלם שנבנה על שכנוע, שהקונה הכי רווחי באתר לא ניתן לשכנוע, אלא רק ליידוע? והתשובה הזו, תשנה את ה-eCommerce וה-ad business הרבה יותר מכל פרוטוקול שייכתב.
עד הפעם הבאה, תהיו טובים, ותמשיכו להיות סקרנים. יאללה ביי.