06.09
多模态理解与生成
只会读写文字的 Agent,等于既聋又瞎:它看不懂用户发的截图、听不懂录音,更别提自己画图、剪视频。这篇围绕 DashScope 上 Qwen 与万相两族模型,讲透多模态 Agent 的两条能力主线——「理解」(图片/音频/视频 → 文字)与「生成」(文字/图片 → 图像/视频),并点破背后的两套调用协议与「同步调用 vs 异步任务」的分水岭,适合想给 LangChain.js 应用接上多模态能力的开发者
→ 阅读
✦ 大道至简 · 时光是画在卷上的河流 · 行到水穷处,坐看云起时