寫那篇食記的流程是這樣的:把 10 張照片拼成一張聯絡表、憑它挑出最好的 3–4 張、從照片裡的價目板讀出實際價格、再據實替每張寫 alt。整條流程的本質是「看」——而不是「寫」。
因為要在有限資源下判斷十幾張圖,我們先用一小段程式把縮圖拼成一張聯絡表,讓 agent 只看這一張、就能挑出要用的幾張——而不是一張張把大圖載進來。這一步本身,就已經預設了「這個 agent 看得到圖」。
如果把這件事丟給一個在終端機裡跑、看不到圖的純文字 coding agent,它會很配合地照做——然後盲挑照片、把 alt 瞎掰、甚至把價格「合理地」編出來。這正好踩中我們對這個客戶內容最硬的一條線:不要自己編。價格要從照片裡的價目板讀,評價要有依據,這些都需要真的「看見」。
挑 AI 不是先問「哪個比較強」,而是先問「這任務要不要看/聽/跑」。任務的模態,比模型的排名更早決定成敗——一個看不到圖的聰明模型,在看圖的任務上只會聰明地編造。





