← 回到研討會書架 ← 回到選擇
12:00

04 用 Claude Managed Agents 更快走進生產環境

Jess Yan · Michael Cohen(Anthropic)× Yusuke Kaji(Rakuten)

有請 Anthropic 技術成員(members of technical staff),Jess Yan 與 Michael Cohen 上台。

能力的指數曲線——為什麼基礎設施成了新的瓶頸

歡迎來到 Code with Claude,各位。我是 Jess,負責 Claude Managed Agents 的產品。我是 Michael,負責 Claude Managed Agents 的工程。看到 Claude Managed Agents 的自發採用,以及我們如何實質加速開發者的工作流程,真的非常令人興奮。這就是我們今天想分享的故事。從顛覆型新創到最大型的企業,我們都看到了採用,我們想確保各位也都能受益於他們所獲得的那種經驗。

首先,我們會講我們在 AI 能力上看到的指數曲線,以及這對打造 agent 意味著什麼。我們會談我們在 agentic 開發中看到的模式,以及為什麼這促使我們打造 Claude Managed Agents。我們會走一遍打造 agent 的基礎元件,包括一些我們最近發布的功能。最後,我們會用一場與我們的日本英雄級用戶 Rakuten 的爐邊對談收尾。

正如大家所見,模型正以指數速度變強,我們的期望也是。模型能力越進階,我們委派的工作就越精密。我們現在看到的瓶頸,越來越是基礎設施,而不是智慧本身。讓我們把這件事說得具體一點。兩年前 Opus 3 發布時,你可能讓它寫並測試一個元件,那要花幾分鐘的專注工作。去年我們的 Claude 4 模型出來時,我們升了一級:你可以除錯一整組檔案,可能工作一小時左右,但全程要重度掌舵。今年,用我們最新的模型,你已經能看到它們跨 agent 團隊整夜運行,監聽你的 Linear backlog,在你醒來之前把整個清單處理完。而我們推測,在不久的將來,有了像 Fable 這麼強的模型,我們會進入一個 agent 有能力完成「過去要一整個團隊花上好幾季」的任務的世界,而且 agent 會完全自主地執行。你可能會看到多 agent 系統能夠協調並端到端跑完一整條 M&A 管線,只花我們所需時間的一小部分。所以,當任務從低階指令畢業、走向端到端的成果描述,我們需要的就遠不只是 prompt 加一個工具迴圈。我們需要可靠、可擴展的 agentic 基礎設施。

完全正確。而且這些任務越複雜,我們就得給 agent 越深的存取權,它們才會有效。有了像 Fable 這樣的模型,它們能做非常複雜的任務。你不可能在不給憑證、內部知識庫或資料庫存取權的情況下,跑出一個有效的 agent。如果你要這些 agent 為你產出程式碼,你得給它們你真正的 codebase 的存取權,讓它們能開 PR、進到生產環境。最後,你需要賦予它們身分與驗證。我們的 agent 越來越不只是以 Claude 的身分行動,而是以我或 Jess 的身分——帶著我們的 email 和我們的 Slack。

而當我們賦予 agent 這些類人的能力,我們也期望以更類人的方式與它們互動。改變的不只是互動的時長,還有互動的形狀。有些 agent 非常對話式:你一路掌舵、給指引,覺得它走偏了甚至可以打斷它。有些 agent——在 Fable 這樣的新模型上——非常成果導向:如果你對想看到的成果有強訊號或一份評分準則(rubric),你可以把準則交給它,讓它迭代到你的退出條件被滿足為止。最後,你可能幾天前開了一個任務,想在很久之後再接手。一個健全的 agent 平台必須支援所有這些互動模式。而我們提供的基礎設施與原語,必須開箱即用地給你這一切,同時保持非常大的彈性,讓你能依需求客製。

為什麼打造 Claude Managed Agents

所以現在很清楚了:我們對 agent 期望很高,而歷史上這意味著我們把負擔推給了你——開發者。在推出 Claude Managed Agents 之前我們做的研究中,我們看到開發者真心渴望和我們一起攀登這條指數曲線,但在幾個關鍵領域苦苦掙扎。第一,context 管理。在對的時間給對的 context,其實非常難調——儘管它完全必要——而在錯的時間給 context,對你的 agent 會是巨大的干擾。我們有一半的開發者表示,基礎設施問題是他們進入生產環境的頭號阻礙。agent 會產生突發式的工作負載,有難以預測的運算模式;要在安全擴展的同時還達到延遲目標,超級困難。最後,可觀測性真的非常難。你怎麼知道你的 agent 產出的品質好不好?這些是非確定性的模型,而且產出巨量的非結構化資料。

於是,Claude Managed Agents 登場。平台的工作我們做了,你就不用做。Managed Agents 把基礎設施、agentic 原語,和開箱即用的可觀測性結合在一起,全部打包在 Claude 平台上提供。這場簡報接下來會更詳細地逐一介紹這些元件,還有幾個 demo。

基礎元件:agent、環境、session、事件

alt text

來談談 Claude Managed Agents 最基本的元件。

- 最核心的,是一個你定義的 agent。這包括 system prompt、你想用的模型、任何你想載入 agent 的 skill,以及你想讓 agent 擁有的工具與工具權限。這像是 agent 的身分。

- 接著,是你設定的環境。這像一個模板,你在裡面定義網路允許清單和任何想預先安裝的套件。這像是 agent 將要生活的世界。

- 你拿環境和 agent,用它們來執行一個 session。一個沙箱會為你配置好,我們架好 harness,Claude 開始執行。任何你想包含在 session 裡的憑證與資源,都會掛載進去,供 Claude 使用。

- 最後,我們有事件(events)。這是 agent 在執行動作時產出的任何東西,或任何你想從上游提供、用來掌舵 agent 的事件。

這是你保持在迴圈中的方式。事件與有狀態的感知,正是我們得以提供一個讓你能在其上打造自己產品的平台的關鍵;你還可以用記憶等原語,以及我們的其他功能,真正優化這些 agent 的表現。

就像 Michael 提到的,agent 事件是一個 agentic 整合的心臟與核心。我們來揭開它在實務上的面貌。

alt text

Managed Agents 裡的一切都是事件為基礎的。這些是結構清楚的持久化逐字紀錄,幫你追蹤 agent 的進度。首先是 user 事件:這是你實際送給 agent、用來引導它的東西。接著是 agent 事件:這是 agent 實際在做的事——訊息、工具執行、context 壓縮,甚至委派給其他 agent。再來是 session 事件:這是你理解「你剛委派的這個工作單元」進度的方式——整體生命週期、狀態轉換、錯誤,以及成果流程。最後是 span 事件。事件流裡發生的事很多——它幫你把相關事件分組,以更聚合、更儀表化的方式看事情。

Demo:跑在 Managed Agents 上的分析 agent「Pascal」

我們轉到一個用 Claude Managed Agents 打造的真實範例:Pascal。它使用一個虛構的線上雜貨外送服務的訂單資料,分析資料並為團隊提供洞察。這個 agent 利用預載的資料集,加上我們安裝並上傳到它工作容器裡的一組 Python 套件與腳本,在幾分鐘內產出分析。你可以在 Claude console https://console.anthropic.com 看到每一個事件,甚至跟一個除錯 agent 聊天,進一步優化你的整合。

進到影片本身:這是 Pascal 的首頁。

alt text

我們可以啟動一個 agent session,Claude 會開始工作,大概需要幾分鐘完成。趁這個時間,我們到 developer console,實際看 Claude 即時產出的事件,更清楚地理解 Claude 正在做什麼。我們也可以看這個 session 所設定的 agent 設定與環境設定。在這個例子裡,這是 system prompt、這是模型。換到環境設定,你可以看到允許的網路權限與套件。跳回頁面本身,看起來分析差不多完成了,我們可以深入 Claude 找到的洞察。產品面看起來香蕉非常受歡迎——還有一堆其他熱門商品,但大家都該買香蕉。看顧客洞察,我們看到星期天下午是線上訂單的高峰,所以你可能想把訂單排到一天裡的其他時段。最後,我們做了這個預測模擬器,讓我們分析顧客是否更可能回購。跳回 developer console,你可以在側欄看到,我們可以對這個 session 本身啟動一次分析:Claude 會看所有事件,進一步為我們找出優化整合的洞察。在這個例子裡,我們看到我們給 Claude 的某些腳本其實非常慢,所以我們可能要優化我們為它們寫的 Python 程式碼,讓它們表現更好。

入門方式與近期提供的功能

我們剛看了 developer console 的實際運作,但今天要開始用 Claude Managed Agents、與你建立的這些 agent 互動,其實有很多途徑。

alt text

挑最適合你工作流程的就好。我最喜歡的是今天就在 Claude Code 裡提供的 Claude API skill。你只要問 Claude:嘿,我想開始用 Claude Managed Agents,它就會引導你把它接進你既有的 codebase。其次,我們最近也發布了 ant CLI https://platform.claude.com/docs/en/api/sdks/cli ,讓你在腳本與 CI/CD 管線裡與我們的 API 互動變得非常容易。最後,我們有開發者文件和 cookbook https://github.com/anthropics/claude-cookbooks ,提供大量實用、可直接複製貼上的 Claude Managed Agents 常見模式範例。

基礎講完了,我想談談我們最近提供的一些進階功能。

alt text

第一,多 agent 編排:Claude 能把任務委派給擁有獨立 context window 的其他 agent,把越來越複雜的工作平行化。

透過 outcomes,Claude 會對預先定義的退出條件或評分準則迭代,直到滿足目標。目標由你負責,完成由 Claude 負責。

透過記憶,Claude 能讀寫記憶儲存。預設上,沒有記憶的 Claude 每個 session 都從零開始;有了記憶,它對先前的執行有感知,下次能做得更好。

dreaming 建立在記憶之上:Claude 會反思學到的東西,把它編纂成新的記憶,確保它能持續以一組更緊湊、更精選、更優化的記憶開始。這些都是非常令人興奮的智慧功能,我們很期待把 agent 能產出的天花板再往上推。

不過,我們也聽到:我們得在你們所在的地方與你們相會,也就是讓我們的基礎設施更模組化。有了自託管沙箱(self-hosted sandboxes),你可以把 agent 迴圈與工具執行直接放在你的基礎設施裡,檔案與套件永遠不離開你的邊界。

有了 MCP tunneling,Claude 能存取你不想暴露在公開網際網路上的私有 MCP 伺服器。這些都是為了讓你能在你的企業裡、在你自己的安全原則之內部署。

而在這些既有功能之外,就像 Katelyn 今天稍早提到的,我們剛發布了兩個非常令人興奮的新功能。一個是排程部署(scheduled deployments),讓你設定一個循環排程,我們會代你觸發新的 session,處理任何你有的週期性工作。另一個是 vault 裡的環境變數,讓你為任何想讓 Claude 呼叫的 API 或 CLI 提供安全憑證,完全不必擔心 Claude 看到真正的祕密 token。

alt text

再深入一點講 vault 裡的環境變數怎麼運作:我們在 Claude 能存取的容器裡,放一個不透明的占位 token。每當 Claude 要打 API 或用 CLI,它就像用任何其他環境變數一樣使用它。而在網路請求發出的那一刻,我們會在請求送出時注入真正的祕密值,所以 Claude 從頭到尾都不會看到祕密 token 的值。

alt text

爐邊對談:Rakuten 的 Yusuke Kaji

非常謝謝你,Michael。和你一起打造這個平台太有趣了。現在我很興奮地歡迎 Rakuten AI for Business 的 General Manager,梶祐輔(Yusuke Kaji)san 上台,聊聊他在打造的東西。歡迎。

Rakuten 把自己的 AI 策略稱為「AI-nization」,而 agent 是它的下一個大階段。那在日常裡是什麼樣子?

是的。首先,謝謝邀請我們上台,也歡迎來到日本。對 Rakuten 來說,我們的 AI-nization 活動,基本上是我們在「你提到的能力曲線」與「現實中的採用」之間補上落差的努力。我們做的是:隨著你們每個月、每一季發布新模型,我們從零開始徹底重新設計我們的工作流程,如此一來,透過徹底重設計工作流程,我們基本上才能完全釋放新模型智慧的潛力。

明白,明白。那麼,讓 agent 在 Rakuten 進入生產環境,花了你們什麼?知道你們在這條路上走了一陣子——如果今天從零開始,你會跳過什麼?

是的。當我們開始自己開發 agent 時,我們花了大量時間和力氣去管理 agent 的基礎設施。但如果是今天重新開始,我們會跳過那個過程,把全部焦點放在 agent 體驗,以及建立某種迴圈——把 agent 的迴圈閉合——而不是把時間花在基礎設施上。

明白。很高興聽到 Managed Agents 現在正在加速這些工作。那麼,隨著時間,什麼對你們 agent 產出品質的影響最大?

我會說,自我演化的能力會是最大的差異化因素。基本上,第一天我們部署 agent,一開始會有一些錯——我們的 agent 會犯一些錯。但藉由啟用你剛剛描述的記憶與 dreaming,我們能讓 agent 透過檢視自己過去執行的軌跡來提升能力,然後,你知道,去解決它們上次犯的問題或錯誤。多虧了這個,我們實際解決了真實流程中最初遇到的 90% 的問題;也多虧了這個,我們的 agent 變得更省 token,延遲和成本也顯著下降。

很高興聽到你們從這些功能得到這麼多價值。今天早上我們也剛宣布了排程部署功能。Rakuten 最先把哪些週期性工作放上排程?

是的。首先,我們把大量報表與分析任務放進了排程部署。我們公司有許多需要重複性工作的流程或任務。例如,我們有大量的銷售報表或行銷報表,需要簡報 deck 或試算表,並做一些資料分析。多虧排程部署,我們能自動化那些重複任務,把它們委派給我們的 agent。另外——抱歉——我們的進階使用者也用它從我們的公有雲拉取日誌與指標,讓產品經理不用建任何新儀表板,就能看到應用程式的健康狀態。

非常令人興奮。同樣地,我們也發布了 vault 支援的環境變數,讓 agent 能使用帶驗證的工具而永遠看不到金鑰。這為你們解鎖了什麼?

我剛提到的使用情境,其實正是被這個 vault 解鎖的。因為,你知道,為了確保我們能安全地使用 agent、符合我們的治理與合規,我們要確保那些 API 金鑰和憑證不會暴露給 agent 本身。多虧這個 vault,我們才能讓這個監控 agent 上線,讓我們能即時看到應用程式的狀態。

非常、非常令人興奮。你們一直站在我們所打造事物的最前緣,我們等不及繼續和你們一起推進這個平台。是的,謝謝。

收尾

今天你們聽到了 Claude Managed Agents 作為一個平台,如何加速我們一些最前緣使用者的工作與工作流程。你們也聽到了 Rakuten 的 Yusuke-san 分享,他的團隊的生產力如何因為 Claude Managed Agents 而實質加速。如果今天這些內容引起你的共鳴——我希望有——歡迎走到我們的 demo 攤位,我們整天都在,展示一些 demo,並回答關於 Claude Managed Agents 的問題。另外,你現在在螢幕上看到的這些 QR code,指向我們一些更實戰的資源,例如我們的文件,以及 console 裡一個讓你幾分鐘內從零打造一個 agent 的豐富體驗。真的非常感謝大家今天留下來,聽我們講我們打造的東西。等不及看你們已經打造的,以及未來將打造的東西。

← 回到選擇 下一個:05 Rakuten 的 AI-nization:自律化 × 賦能(日文場) →