תכנון ופירוק משימה (Task Decomposition)

כלים וסוכנים

הגדרה

תכנון ופירוק משימה (Task Decomposition, ומכונה גם Planning) הוא המרכיב שבו סוכן AI מפרק מטרה מורכבת לרצף צעדי-ביניים, מחליט מה הצעד הבא, ומשנה את התוכנית כשמתברר שאינה עובדת.

המרכיב השני: מי מחליט מה הצעד הבא

הערך סוכן בינה מלאכותית באתר הזה מגדיר סוכן לפי שלושה מרכיבים שנוספים מעל מודל-שפה רגיל: קריאה לכלים, תכנון, וזיכרון. תכנון ופירוק משימה הוא המרכיב השני — ההחלטה מה הצעד הבא, ולפניה ההחלטה לאילו צעדים המשימה בכלל מתפרקת.

זה נשמע מובן מאליו, אבל הוא לא. כשמשתמש מבקש "עבור על תיקיית החשבוניות של החודש והפק ממנה דוח הוצאות", אף אחד לא אמר לסוכן שיש כאן פתיחת קבצים, חילוץ סכומים, סיווג לקטגוריות, סיכום והרכבת מסמך, ובאיזה סדר. מישהו צריך לייצר את הרשימה הזו — ובסוכן, מודל שפה גדול הוא שמייצר אותה בעצמו, בשפה טבעית, לפני שהוא מתחיל לפעול.

בסקירת ארכיטקטורות הסוכנים של ליליאן וונג (Lilian Weng) מיוני 2023 — רשומת-בלוג אישית ולא מאמר שעבר שיפוט-עמיתים; וונג הקימה באותה שנה את צוות מערכות-הבטיחות של OpenAI ועמדה בראשו — התכנון מוגדר כמרכיב שמאפשר שני דברים נפרדים: פירוק המשימה לחלקים, וביקורת עצמית (Reflection) — היכולת לבחון את מה שנעשה עד כה ולשנות את התוכנית. ההבחנה חשובה, כי תוכנית שנקבעה בתחילת המשימה עלולה להתברר כשגויה באמצעה, והשאלה אם הסוכן מזהה את זה ומשנה כיוון נפרדת לגמרי מהשאלה אם ידע לפרק את המשימה מלכתחילה.

פירוק כטכניקת-הנחיה: משרשור מחשבה למהקל-לכבד

הפירוק לא נולד עם הסוכנים. הוא הופיע קודם כטכניקת-הנחיה למודלים רגילים, עוד לפני שדובר על סוכנים בכלל, והנקודה שממנה נהוג להתחיל היא שרשור מחשבה, שפרסמו ג'ייסון וויי (Jason Wei) ועמיתיו בינואר 2022. הרעיון: לגרום למודל לייצר סדרה של צעדי-נימוק ביניים לפני התשובה הסופית, במקום לקפוץ ישר אליה. המאמר מדווח שהנחיה של מודל בן 540 מיליארד פרמטרים בשמונה דוגמאות בלבד מהסוג הזה הגיעה לתוצאת-שיא במבחן GSM8K של בעיות-מילוליות בחשבון.

מאי 2022 הביא צעד נוסף: דני ג'ואו (Denny Zhou) ועמיתיו הציגו "מהקל לכבד" (Least-to-Most), שבו הפירוק אינו רק נימוק אלא מבנה מפורש — המודל מפרק את הבעיה לסדרה של תת-בעיות פשוטות יותר, ופותר אותן בזו אחר זו, כשהתשובה לכל אחת מסייעת לפתור את הבאה. התוצאה שדווחה חדה במיוחד: במבחן ההכללה SCAN, מודל code-davinci-002 עם ארבע-עשרה דוגמאות הגיע לדיוק של 99 אחוזים ומעלה בכל חלוקה של המבחן, לעומת 16 אחוזים באותו מודל עם שרשור-מחשבה.

וונג מציינת שגם ניסוח פשוט בהרבה עובד לעיתים — הנחיה בנוסח "שלבים לביצוע X", ואחריה המספר 1. עד כמה הדפוס הזה נפוץ בפועל אי-אפשר ללמוד ממנה; מסמך הנדסי של Anthropic מדצמבר 2024, שמסכם עבודה עם עשרות צוותים שבנו סוכנים, מדווח שהמימושים המוצלחים ביותר היו דווקא אלה שהשתמשו בדפוסים פשוטים וניתנים-להרכבה ולא במסגרות-פיתוח מורכבות — ופירוק המשימה לרצף שלבים הוא הפשוט שבדפוסים שהמסמך מונה.

כשיש יותר ממסלול אחד: עץ-מחשבות ומתכנן חיצוני

לפירוק לינארי יש חולשה ברורה: הוא בוחר מסלול אחד וממשיך בו. אם הצעד השני היה טעות, כל מה שנבנה עליו טועה איתו, ואין מנגנון לחזור אחורה.

התשובה המחקרית לכך היא Tree of Thoughts ("עץ-מחשבות"), שהציגו שאניו יאו (Shunyu Yao) ועמיתיו במאי 2023. במקום שרשרת אחת, המודל פורש בכל צעד כמה המשכים אפשריים, מעריך אותם, ובוחר במה להמשיך — מבנה של עץ במקום קו, עם אפשרות לנטוש ענף ולחזור. את ההערכה עצמה — איזה ענף שווה המשך — אפשר לעשות בשתי דרכים, כפי שמסכמת וונג: לתת למודל לסווג כל אפשרות, או להריץ אותה כמה פעמים ולהצביע. הפער שדווח במאמר גדול: במשחק "24", GPT-4 עם שרשור-מחשבה פתר 4 אחוזים מהמשימות, ואילו אותו GPT-4 עם עץ-מחשבות הגיע ל-74 אחוזים.

כיוון שלישי לגמרי מוותר על כך שהמודל יתכנן בעצמו. בגישה שמכונה LLM+P, שאותה מתארת וונג, המודל רק מתרגם את הבעיה לשפת-תיאור פורמלית של בעיות-תכנון, ואת התוכנית עצמה מייצר מתכנן קלאסי — תוכנה מתחום-תכנון ותיק בבינה המלאכותית, שאיננה מודל-שפה כלל. המודל, בגישה הזו, הוא המתרגם ולא המתכנן.

שלוש הגישות האלה אינן רשימה מקרית: סקירת-מחקר שיטתית על תכנון בסוכני-שפה, שפרסמו שו הואנג (Xu Huang) ועמיתיו בפברואר 2024, ממיינת את העבודות בתחום לחמישה כיוונים — פירוק-משימה, בחירת-תוכנית, מודול חיצוני, ביקורת עצמית וזיכרון — ושלושת הראשונים הם בדיוק הפירוק הלינארי, עץ-המחשבות והמתכנן החיצוני.

תוכנית קבועה מראש מול תכנון תוך כדי ריצה

ההבחנה המעשית החשובה בתחום הזה אינה בין טכניקות-הנחיה, אלא בשאלה מי קבע את רצף הצעדים — מתכנת מראש, או המודל בזמן אמת.

אותו מסמך הנדסי של Anthropic מדצמבר 2024 מנסח את ההבדל בחדות: "תהליכי-עבודה" (Workflows) הם מערכות שבהן מודלים וכלים מתוזמרים דרך מסלולי-קוד שהוגדרו מראש, ואילו "סוכנים" (Agents) הם מערכות שבהן המודל מכוון בעצמו את התהליך ואת השימוש בכלים, ושומר על שליטה באופן שבו הוא משיג את המשימה. המסמך מונה חמישה דפוסים מהסוג הראשון — שרשור-הנחיות, ניתוב, הרצה מקבילה, מתזמר-ועובדים, ומעריך-משפר. בכולם יש פירוק של המשימה לצעדים; ההבדל הוא שהפירוק נקבע בקוד, ולא על ידי המודל תוך כדי ריצה.

המסמך גם מזהיר במפורש מפני מורכבות מיותרת, וממליץ להוסיף אותה רק כשהיא משפרת את התוצאה באופן שניתן להראות. העצה רלוונטית במיוחד כאן, כי מבין שלוש הדרכים לבצע משימה — קריאה בודדת למודל, תהליך-עבודה שהוגדר מראש, וסוכן שמתכנן לעצמו — הסוכן המתכנן הוא היקר והשביר שבהן.

למה משימה ארוכה נתקעת באמצע

זו השאלה שהתכנון קיים כדי לענות עליה, והתשובה הכנה היא שהוא עונה עליה רק חלקית.

הכשל הבסיסי הוא הצטברות: ככל שהרצף ארוך יותר, כך גדל הסיכוי שצעד אחד ישתבש — וכל הצעדים שנשענים עליו יורשים את השגיאה, גם אם בוצעו נכון כשלעצמם. מה שנמדד בפועל אינו התכנון אלא התוצאה הסופית: מאמר של ארגון המחקר METR ממרץ 2025 הציע מדד בשם "אופק-זמן בשיעור-הצלחה של 50%": הזמן שלוקח לבני-אדם בעלי מומחיות רלוונטית להשלים משימות שמודל מצליח בהן ב-50 אחוז מהמקרים. לפי המאמר, מודלי-חזית באותה עת, ובהם Claude 3.7 Sonnet, עמדו על אופק-זמן של כחמישים דקות, והמדד הזה הכפיל את עצמו בערך כל שבעה חודשים מאז 2019 — אם כי המחברים מציינים שייתכן שהמגמה האיצה ב-2024, ודנים במגבלות של התוצאות, ובכללן עד כמה הן ניתנות להכללה מעבר למשימות שנבדקו.

חשוב לקרוא את המספר הזה נכון: הוא מודד משימה שלמה, לא תכנון — הוא אינו מפריד בין התכנון לבין הביצוע, השימוש בכלים והזיכרון. יתרה מזו, המאמר עצמו מייחס את עליית האופק בעיקר לאמינות גבוהה יותר וליכולת להסתגל לטעויות, לצד היגיון ושימוש-בכלים טובים יותר. שגם התכנון נעשה קשה יותר ככל שהמשימה מתארכת היא פרשנות סבירה למספרים האלה, לא טענה שהמאמר טוען.

הכשל השני הוא היעדר תיקון. הכיוון המחקרי שמטפל בו נקרא Reflexion, שהציגו נח שין (Noah Shinn) ועמיתיו במרץ 2023: הסוכן מנסח במילים מה השתבש בניסיון שנכשל, שומר את הניסוח במאגר זיכרון אפיזודי, וקורא אותו בניסיון הבא. הערך נמק ופעל באתר הזה מתאר את השיטה ואת התוצאות שדווחו עליה. מה שחשוב כאן הוא היחס בין שני המרכיבים: התכנון והזיכרון נשענים זה על זה — מנגנון תיקון-עצמי כזה דורש מקום לשמור בו את הלקח מניסיון לניסיון. אותה סקירה מפברואר 2024 אכן ממיינת זיכרון כאחד מחמשת הכיוונים לשיפור התכנון.

מה זה אומר בפועל למי שמפעיל סוכן

שלוש מסקנות מעשיות עולות מכל זה, וכולן נוגעות למי שמשתמש בסוכן ולא רק למי שבונה אותו.

הראשונה: ככל שהמשימה ארוכה יותר, כך עדיף שהפירוק ייעשה מראש ולא יישאר כולו בידי הסוכן. סוכן שמקבל מטרה אחת גדולה ומעורפלת נדרש לייצר תוכנית שלמה מהנקודה שבה הוא יודע הכי מעט על הבעיה. סוכן שמקבל כמה שלבים מוגדרים מייצר תוכנית קצרה בכל פעם — והצטברות הטעויות, שהיא הכשל המרכזי, נקטעת בין שלב לשלב.

השנייה: משימה שאפשר לבדוק את סופה עדיפה על משימה שאי-אפשר. סוכן שיודע מה נחשב "גמור" — קוד שעובר בדיקות, טופס שהתקבל, קובץ שנוצר — יכול להשוות את המצב לתוכנית ולתקן. סוכן שהמטרה שלו מנוסחת כתחושה ימשיך לפעול בלי לדעת שהוא כבר סטה.

השלישית נוגעת לגבול של התחום: אם רצף הצעדים ידוע וקבוע מראש, אין צורך שהסוכן יתכנן בזמן אמת. הפירוק עדיין קיים — אדם פשוט עשה אותו מראש — וזו אוטומציית תהליכי עבודה, זולה, מהירה וצפויה בהרבה. תכנון בזמן אמת שווה את מחירו רק כשהצעדים באמת אינם ידועים מראש. ובכל מקרה שבו הסוכן מתכנן פעולות בלתי-הפיכות, נקודת עצירה לאישור אנושי — אדם-בלולאה — היא הגנה מעשית מפני תוכנית שגויה שמתבצעת עד סופה.

שלוש שיטות לפרק משימה, וההבדל ביניהן (המספרים בשורה האחרונה אינם בני-השוואה זה לזה — מבחנים ומודלים שונים)
שרשור מחשבה (Chain of Thought)מהקל לכבד (Least-to-Most)עץ-מחשבות (Tree of Thoughts)
מה השיטה עושהמייצרת שרשרת צעדי-נימוק בתוך תשובה אחת, לפני התשובה הסופיתמפרקת מראש לתת-בעיות פשוטות ופותרת אותן בזו אחר זופורשת כמה המשכים אפשריים בכל צעד ומעריכה אותם לפני שממשיכים
בוחנת יותר ממסלול אחד?לא — מסלול נימוק יחידלא — סדרה אחת של תת-בעיותכן — מבנה עץ, עם אפשרות לנטוש ענף
הוצגה על ידי / מתיג'ייסון וויי ועמיתיו, ינואר 2022דני ג'ואו ועמיתיו, מאי 2022שאניו יאו ועמיתיו, מאי 2023
מה נמדד, ובאיזה מבחןGSM8K, בעיות מילוליות בחשבון: שמונה דוגמאות-הנחיה על מודל בן 540 מיליארד פרמטרים הביאו לתוצאת-שיא באותה עתSCAN, מבחן הכללה: 99 אחוזים ומעלה עם המודל code-davinci-002, לעומת 16 אחוזים לאותו מודל עם שרשור-מחשבהמשחק "24": 74 אחוזים עם GPT-4, לעומת 4 אחוזים לאותו GPT-4 עם שרשור-מחשבה

שאלות נפוצות ❓

מה ההבדל בין תכנון לבין קריאה לכלים?

קריאה לכלים היא היכולת לבצע פעולה חיצונית; תכנון הוא ההחלטה איזו פעולה נחוצה עכשיו, ומה יבוא אחריה. בלי תכנון, הסוכן יודע לפעול אבל לא יודע לאן.

למה משימה ארוכה נתקעת באמצע?

ברצף ארוך די בטעות אחת כדי לפגוע בכל מה שנבנה עליה, והתוכנית המקורית ממשיכה להתבצע גם כשהמציאות כבר סותרת אותה. מאמר של METR ממרץ 2025 מדד את הצד התוצאתי של זה: אורך המשימה — במונחי הזמן שלוקח לאדם מקצועי להשלים אותה — שבו מודלי-החזית של אותה עת הצליחו ב-50 אחוז מהמקרים היה כחמישים דקות.

האם עדיף לתת לסוכן מטרה אחת גדולה או כמה שלבים?

כמה שלבים מוגדרים, בדרך כלל. זה מקצר את התוכנית שהסוכן צריך לייצר בכל פעם, וקוטע את הצטברות הטעויות בין שלב לשלב.

מתי בכלל לא צריך סוכן שמתכנן?

כשרצף הצעדים ידוע וקבוע מראש. הפירוק עדיין קיים, אבל אדם עשה אותו מראש — זו אוטומציית תהליכי עבודה, שהיא זולה, מהירה וצפויה בהרבה מסוכן שמתכנן בזמן אמת.