[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"consumer-news-detail-1019":3,"consumer-news-interaction-1019":41,"consumer-news-related-1019":44},{"detail":4,"item":36},{"card":5,"schemaVersion":23,"fields":24,"content":30},{"id":6,"kind":7,"targetType":8,"targetId":9,"subtype":7,"typeLabel":10,"title":11,"subtitle":12,"summary":13,"coverUrl":14,"badgeText":15,"href":16,"sourceName":12,"meta":17,"metrics":20,"tags":21,"resolved":22},"NEWS_ARTICLE:1019","news","NEWS_ARTICLE",1019,"资讯","扣子搭视频生产智能体：跑通1小时排坑一下午","博客园","一句话结论：智能体之前也搭建过，整体不算太难，但是搭视频智能体这块还没完整的试过，我选了个能出成品的方向——输入一个成语，自动产出一条带画面、配音、字幕的视频。用扣子（Coze）搭大脑一小时就跑通了，但真正让它&quot;能用&quot;，又用 Codex 调试了一下午。看到抖音上面很多有意思的视频","https:\u002F\u002Fwww.shanwaiyun.top\u002Fuploads\u002Fd970dd34cb470db34b10f78584bb814d.png","","\u002Fnews\u002F1019",[18,19],"2026","人工智能",{},[19],true,"consumer-content-detail-v1",{"sourceName":12,"authorName":25,"categoryName":19,"summary":13,"description":13,"publishTime":26,"updateTime":27,"sourceUrl":28,"language":29},"厚德载物_VIP","2026-09-06T19:51","2026-09-11T15:22:03","https:\u002F\u002Fwww.cnblogs.com\u002Fhellojackyleon\u002Fp\u002F22864417","中文",{"format":31,"policy":32,"normalized":22,"html":33,"text":34,"wordCount":35,"hasBody":22},"HTML","NEWS_CONTENT_V1","\u003Cp>\u003Cimg alt=\"\" src=\"https:\u002F\u002Fi1.wp.com\u002Fwww.shanwaiyun.top\u002Fuploads\u002Fd970dd34cb470db34b10f78584bb814d.png?w=720&amp;quality=65&amp;strip=all\">\u003C\u002Fp>\n\u003Cp>一句话结论：智能体之前也搭建过，整体不算太难，但是搭视频智能体这块还没完整的试过，我选了个能出成品的方向——输入一个成语，自动产出一条带画面、配音、字幕的视频。用扣子（Coze）搭大脑一小时就跑通了，但真正让它\"能用\"，又用 Codex 调试了一下午。看到抖音上面很多有意思的视频，也想倒腾下，做视频这块，我是新手，不排除是我哪里配置错了，把过程原样记下来，懂行的朋友欢迎指正。\u003C\u002Fp>\n\u003Cp>智能体这个词今年太火了。\u003C\u002Fp>\n\u003Cp>但看来看去，网上大部分\"智能体\"就是个聊天框：接个大模型，套层提示词，能问答就叫智能体了。我一直想搭个\u003Cstrong>能干活、出成品\u003C\u002Fstrong>的——不是跟我聊天，是给它一个题目，它把活干完，把结果交到我手上。\u003C\u002Fp>\n\u003Cp>视频这块，第一次上手，选了个小场景：成语故事视频生产智能体。输入\"龟兔赛跑\"，它自动写文案、出画面、配语音、加字幕，最后交给我一个剪映草稿，打开就能导出成片。\u003C\u002Fp>\n\u003Ch2>这个智能体的全貌\u003C\u002Fh2>\n\u003Ctable>\n \u003Cthead>\n  \u003Ctr>\n   \u003Cth>组成\u003C\u002Fth>\n   \u003Cth>干什么\u003C\u002Fth>\n   \u003Cth>用什么\u003C\u002Fth>\n  \u003C\u002Ftr>\n \u003C\u002Fthead>\n \u003Ctbody>\n  \u003Ctr>\n   \u003Ctd>大脑：工作流\u003C\u002Ftd>\n   \u003Ctd>理解题目、策划内容、生产素材、组装草稿\u003C\u002Ftd>\n   \u003Ctd>扣子 + 豆包 2.0 pro + Seedream + seedance\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n   \u003Ctd>手脚：工具链\u003C\u002Ftd>\n   \u003Ctd>把云端草稿落地到本地剪映\u003C\u002Ftd>\n   \u003Ctd>剪映小助手插件（米核）+ Codex 技能\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n   \u003Ctd>产出\u003C\u002Ftd>\n   \u003Ctd>50 多秒成品视频草稿\u003C\u002Ftd>\n   \u003Ctd>剪映专业版\u003C\u002Ftd>\n  \u003C\u002Ftr>\n \u003C\u002Ftbody>\n\u003C\u002Ftable>\n\u003Cp>工作流只是其中一个环节——虽然是最核心的那个。大脑想清楚了，手脚跟不上，智能体照样瘫痪。后面会讲到，我这一下午就卡在\"手脚\"上。\u003C\u002Fp>\n\u003Ch2>最终效果\u003C\u002Fh2>\n\u003Cp>输入一个成语主题，智能体自动产出一条 50 多秒的成品草稿：6 段画面、6 段配音、6 条字幕，打开剪映就是排好版的时间线，字幕、配音、画面严丝合缝。\u003C\u002Fp>\n\u003Cp>视频版每段画面是 seedance 生成的 10 秒动态视频，下面是同一段视频第 1、5、9 秒的抽帧，松鼠的姿势和场景都在动：\u003C\u002Fp>\n\u003Cp>\u003Cimg alt=\"\" src=\"https:\u002F\u002Fi1.wp.com\u002Fwww.shanwaiyun.top\u002Fuploads\u002Fecf81178f6d0175d33343de3b96465af.png?w=720&amp;quality=65&amp;strip=all\">\u003C\u002Fp>\n\u003Cp>静态抽帧只能看出场景在变，视频有点大，不好上传，这里就不完整展示视频了\u003C\u002Fp>\n\u003Cp>\u003Cimg alt=\"\" src=\"https:\u002F\u002Fi1.wp.com\u002Fwww.shanwaiyun.top\u002Fuploads\u002F06090a34cb832c9b050bf49b1ab8f03c.png?w=720&amp;quality=65&amp;strip=all\">\u003C\u002Fp>\n\u003Ch2>智能体的大脑：工作流三段流水线\u003C\u002Fh2>\n\u003Cp>\u003Cimg alt=\"\" src=\"https:\u002F\u002Fi1.wp.com\u002Fwww.shanwaiyun.top\u002Fuploads\u002F59274af1cfc1af9ee560405ddcf4d2dc.png?w=720&amp;quality=65&amp;strip=all\">\u003C\u002Fp>\n\u003Cp>作为第一次搭视频智能体的人，我按照网上的流程一步一步构建出这些完整的流程。后来静下来捋了一遍，其实就三段：\u003C\u002Fp>\n\u003Cp>\u003Cimg alt=\"\" src=\"https:\u002F\u002Fi1.wp.com\u002Fwww.shanwaiyun.top\u002Fuploads\u002F591cf9027a1b270a9eb041910a6b645c.png?w=720&amp;quality=65&amp;strip=all\">\u003C\u002Fp>\n\u003Cp>\u003Cstrong>第一段，内容策划。\u003C\u002Fstrong> 四个大模型节点串行：1 号写文案（故事正文），2 号固化形象（把兔子、乌龟的外形描述固定下来，后面每张图都带这段描述，角色才不会变脸），3 号把文案切成 6 个分镜，04 节点把每个分镜翻译成绘画提示词。\u003C\u002Fp>\n\u003Cp>\u003Cstrong>第二段，素材生产。\u003C\u002Fstrong> 三个批处理并行跑：图像生成（Seedream 4.0，每分镜一张图）、视频生成（doubao-seedance-pro，每分镜一段视频）、语音合成（speech_synthesis，每分镜一段配音 mp3）。\u003C\u002Fp>\n\u003Cp>\u003Cstrong>第三段，组装草稿。\u003C\u002Fstrong> 五个数据格式化节点（audio_timelines、video_infos、caption_infos、imgs_infos、audio_infos）把素材整理成插件要的格式，然后 create_draft 建空草稿，add_videos、add_captions、add_images、add_audios 依次把四条轨道写进去，结束节点输出草稿 ID。\u003C\u002Fp>\n\u003Cp>整条流水线的时间轴基准是\u003Cstrong>配音时长\u003C\u002Fstrong>：每段配音多长，对应的画面和字幕就排多长。想通这一点之后，整个工作流突然就不难懂了——文案每段写多长，直接决定了视频节奏。\u003C\u002Fp>\n\u003Ch2>智能体的最后一公里：四个现象和 Codex 排查实录\u003C\u002Fh2>\n\u003Cp>大脑跑通，输出草稿 ID，我以为结束了。结果从\"云端草稿\"到\"本地剪映能用的草稿\"这最后一公里，走了一下午。\u003C\u002Fp>\n\u003Cp>先声明：我不确定这些是插件的 bug 还是我自己的配置问题，只是把现象、排查过程和最后的解决办法记下来。\u003Cstrong>有对米核客户端、剪映小助手比较熟悉的朋友，欢迎指导。\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Ch3>现象一：米核 App 下载不了自己的草稿\u003C\u002Fh3>\n\u003Cp>剪映小助手 App 点下载，转圈几秒后报\"下载失败链接\"。一开始以为要充值。后来用 Codex 查了网络请求，发现草稿数据本身是公开接口，\u003Ccode>https:\u002F\u002Fmiheai.com\u002Fplugin\u002Fdraft\u002F草稿ID\u003C\u002Fcode> 直接返回完整 JSON，素材链接用 curl 跟随跳转就能下。可能是 App 下载器对某类签名链接的处理有问题，也可能是我账号哪里没弄对——总之绕过 App 直接拉数据，问题就解决了。\u003C\u002Fp>\n\u003Ch3>现象二：字幕轨有内容，画面里看不到\u003C\u002Fh3>\n\u003Cp>草稿打开，字幕轨明明有内容，播放器里就是没有字。\u003C\u002Fp>\n\u003Cp>Codex 对比了我的草稿和正常草稿，发现轨道数组的顺序不一样：我这个把字幕夹在了视频轨中间。剪映的规则是数组靠后、层级靠上，字幕被上面的视频轨盖住了。把字幕轨挪到所有视频轨之后，字就露出来了。\u003C\u002Fp>\n\u003Ch3>现象三：字幕变成白框，字是透明的\u003C\u002Fh3>\n\u003Cp>层级调好后，选中字幕，画面里只有一个白色线框，字没了。\u003C\u002Fp>\n\u003Cp>这一步查得最久。Codex 把正常草稿的字幕素材和我的逐字段对比，发现我的字幕素材里塞了 60 多个字段，正常草稿只有 12 个；而且填充色缺了透明度字段，背景色为空但背景不透明度是 1。把这些素材按正常草稿的精简结构重建，只保留文字、颜色、字号、位置，白框消失，字也出来了。\u003C\u002Fp>\n\u003Ch3>现象四：改了字幕颜色不生效\u003C\u002Fh3>\n\u003Cp>工作流里把字幕颜色从红色改成米黄色（f9f3c4），重跑，装进去一看，还是旧的棕色。\u003C\u002Fp>\n\u003Cp>Codex 对比发现：素材顶层 \u003Ccode>text_color\u003C\u002Fcode> 是新颜色没错，但正文样式里写的还是旧颜色，两处数据不一致，而剪映渲染认的是正文样式。以顶层颜色为准覆盖过去，就对了。\u003C\u002Fp>\n\u003Cp>这四个问题修完后，我让 Codex 把整个\"拉草稿、下素材、修结构、装进剪映\"的过程封装成了一个技能。现在链路变成：扣子跑完出 ID，技能一条命令装好。\u003Cstrong>到这一步，这个智能体才算真正能干活了。\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Cp>说实话，没有 Codex 这种能直接读草稿文件、逐字段对比的工具，光靠肉眼在剪映界面上点，我可能到现在还在猜。\u003C\u002Fp>\n\u003Ch2>add_captions 参数（我的最终配置）\u003C\u002Fh2>\n\u003Cp>字幕样式全在这个节点的参数里，这是我调到最后能正常显示的组合：\u003C\u002Fp>\n\u003Cp>\u003Cimg alt=\"\" src=\"https:\u002F\u002Fi1.wp.com\u002Fwww.shanwaiyun.top\u002Fuploads\u002Fc0d678f023eb1b0d12686dacbe8f0d9d.png?w=720&amp;quality=65&amp;strip=all\">\u003C\u002Fp>\n\u003Ctable>\n \u003Cthead>\n  \u003Ctr>\n   \u003Cth>参数\u003C\u002Fth>\n   \u003Cth>我的填法\u003C\u002Fth>\n   \u003Cth>说明\u003C\u002Fth>\n  \u003C\u002Ftr>\n \u003C\u002Fthead>\n \u003Ctbody>\n  \u003Ctr>\n   \u003Ctd>alpha\u003C\u002Ftd>\n   \u003Ctd>1\u003C\u002Ftd>\n   \u003Ctd>不透明度，别空着\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n   \u003Ctd>text_color\u003C\u002Ftd>\n   \u003Ctd>f9f3c4\u003C\u002Ftd>\n   \u003Ctd>填充色，以这个顶层参数为准\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n   \u003Ctd>border_color\u003C\u002Ftd>\n   \u003Ctd>和文字同色或对比色\u003C\u002Ftd>\n   \u003Ctd>默认 dad1cf 是浅灰白，容易出\"白框\"观感；同色相当于加粗\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n   \u003Ctd>font_size\u003C\u002Ftd>\n   \u003Ctd>6\u003C\u002Ftd>\n   \u003Ctd>2560 宽画布上 6 号够看\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n   \u003Ctd>transform_x\u003C\u002Ftd>\n   \u003Ctd>0\u003C\u002Ftd>\n   \u003Ctd>水平居中\u003C\u002Ftd>\n  \u003C\u002Ftr>\n  \u003Ctr>\n   \u003Ctd>\u003Cstrong>transform_y\u003C\u002Fstrong>\u003C\u002Ftd>\n   \u003Ctd>\u003Cstrong>-1000\u003C\u002Fstrong>\u003C\u002Ftd>\n   \u003Ctd>重点，见下\u003C\u002Ftd>\n  \u003C\u002Ftr>\n \u003C\u002Ftbody>\n\u003C\u002Ftable>\n\u003Cp>transform_y 这个参数我来回试了好多次才对。实际测下来的规律是：\u003Cstrong>剪映里显示的位置大约只有填值的一半\u003C\u002Fstrong>。画布高 1440，想让字幕在画面中心往下 500 像素，得填 -1000。不知道是我理解错了单位，还是插件和剪映的换算本来就不一致——反正按 2 倍填，位置就是准的。\u003C\u002Fp>\n\u003Ch2>视频生成节点的三个体会\u003C\u002Fh2>\n\u003Cul>\n \u003Cli>\u003Cstrong>时长\u003C\u002Fstrong>：节点可选 5 秒或 10 秒。配音段长度是文案决定的，我这个工作流每段配音 5.4 到 14.9 秒不等，5 秒的视频盖不住长段。选 10 秒，同时把文案每段尽量控制在 10 秒内。\u003C\u002Fli>\n \u003Cli>\u003Cstrong>分辨率\u003C\u002Fstrong>：节点选的是 1080P，实际出片只有 864×480，放到 2K 画布上会糊。不知道是不是我套餐或模型限制，有懂的朋友可以说说。\u003C\u002Fli>\n \u003Cli>\u003Cstrong>提示词\u003C\u002Fstrong>：默认只接分镜描述，生成的视频动作幅度很小，\"动了跟没动一样\"。想要动感，提示词里得加动作和运镜，比如\"兔子快速奔跑，镜头侧面跟随\"。\u003C\u002Fli>\n\u003C\u002Ful>\n\u003Ch2>验证智能体是否真的能干活（我的检查清单）\u003C\u002Fh2>\n\u003Col>\n \u003Cli>工作流跑完，结束节点输出草稿 ID；\u003C\u002Fli>\n \u003Cli>浏览器打开 \u003Ccode>https:\u002F\u002Fmiheai.com\u002Fplugin\u002Fdraft\u002F草稿ID\u003C\u002Fcode>，能看到完整 JSON，说明云端草稿正常；\u003C\u002Fli>\n \u003Cli>装进剪映后查三件事：视频轨在字幕轨下面、字幕颜色字号和工作流设置一致、总时长等于各段配音之和；\u003C\u002Fli>\n \u003Cli>按空格播放，画面动、字幕跟着配音走，收工。\u003C\u002Fli>\n\u003C\u002Fol>\n\u003Chr>\n\u003Ch2>老张心得\u003C\u002Fh2>\n\u003Cp>第一次搭视频智能体，最大的体会是：\u003Cstrong>智能体不是搭个聊天框接个大模型就完事——工作流只是它的大脑，大脑到产出之间还隔着一整条工具链。\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Cp>网上大部分教程教的是\"大脑怎么思考\"，没人教\"手脚怎么落地\"。而真实世界里，卡住你的恰恰是那些没人讲的环节。\u003C\u002Fp>\n\u003Cp>还有一条：结构化数据出问题，别在界面上瞎点，把文件打开逐字段对比，比什么都快。这次全靠 Codex 干这个活。\u003C\u002Fp>\n\u003Cp>最后再说一遍：上面四个现象，到底是插件的问题还是我配置的问题，我没完全搞清楚。\u003Cstrong>有对米核客户端、剪映小助手比较熟悉的朋友，欢迎指导，评论区等你。\u003C\u002Fstrong>\u003C\u002Fp>\n\u003Chr>\n\u003Ch2>互动话题\u003C\u002Fh2>\n\u003Cp>你搭的第一个智能体是干什么的？跑通之后，卡在了哪个\"最后一公里\"？\u003C\u002Fp>\n\u003Cp>你觉得\"能聊天\"和\"能干活\"的智能体，差别到底在哪？\u003C\u002Fp>\n\u003Chr>\n\u003Ch2>关注老张\u003C\u002Fh2>\n\u003Cp>公众号：老张聊运维\u003Cbr>\n  小程序：观简国学\u003Cbr>\n  个人博客：\u003Ca href=\"https:\u002F\u002Fwww.shanwaiyun.top\u002F\" target=\"_blank\" rel=\"noopener noreferrer nofollow\">https:\u002F\u002Fwww.shanwaiyun.top\u002F\u003C\u002Fa>\u003C\u002Fp>","一句话结论：智能体之前也搭建过，整体不算太难，但是搭视频智能体这块还没完整的试过，我选了个能出成品的方向——输入一个成语，自动产出一条带画面、配音、字幕的视频。用扣子（Coze）搭大脑一小时就跑通了，但真正让它\"能用\"，又用 Codex 调试了一下午。看到抖音上面很多有意思的视频，也想倒腾下，做视频这块，我是新手，不排除是我哪里配置错了，把过程原样记下来，懂行的朋友欢迎指正。 智能体这个词今年太火了。 但看来看去，网上大部分\"智能体\"就是个聊天框：接个大模型，套层提示词，能问答就叫智能体了。我一直想搭个能干活、出成品的——不是跟我聊天，是给它一个题目，它把活干完，把结果交到我手上。 视频这块，第一次上手，选了个小场景：成语故事视频生产智能体。输入\"龟兔赛跑\"，它自动写文案、出画面、配语音、加字幕，最后交给我一个剪映草稿，打开就能导出成片。 这个智能体的全貌 组成 干什么 用什么 大脑：工作流 理解题目、策划内容、生产素材、组装草稿 扣子 + 豆包 2.0 pro + Seedream + seedance 手脚：工具链 把云端草稿落地到本地剪映 剪映小助手插件（米核）+ Codex 技能 产出 50 多秒成品视频草稿 剪映专业版 工作流只是其中一个环节——虽然是最核心的那个。大脑想清楚了，手脚跟不上，智能体照样瘫痪。后面会讲到，我这一下午就卡在\"手脚\"上。 最终效果 输入一个成语主题，智能体自动产出一条 50 多秒的成品草稿：6 段画面、6 段配音、6 条字幕，打开剪映就是排好版的时间线，字幕、配音、画面严丝合缝。 视频版每段画面是 seedance 生成的 10 秒动态视频，下面是同一段视频第 1、5、9 秒的抽帧，松鼠的姿势和场景都在动： 静态抽帧只能看出场景在变，视频有点大，不好上传，这里就不完整展示视频了 智能体的大脑：工作流三段流水线 作为第一次搭视频智能体的人，我按照网上的流程一步一步构建出这些完整的流程。后来静下来捋了一遍，其实就三段： 第一段，内容策划。 四个大模型节点串行：1 号写文案（故事正文），2 号固化形象（把兔子、乌龟的外形描述固定下来，后面每张图都带这段描述，角色才不会变脸），3 号把文案切成 6 个分镜，04 节点把每个分镜翻译成绘画提示词。 第二段，素材生产。 三个批处理并行跑：图像生成（Seedream 4.0，每分镜一张图）、视频生成（doubao-seedance-pro，每分镜一段视频）、语音合成（speech_synthesis，每分镜一段配音 mp3）。 第三段，组装草稿。 五个数据格式化节点（audio_timelines、video_infos、caption_infos、imgs_infos、audio_infos）把素材整理成插件要的格式，然后 create_draft 建空草稿，add_videos、add_captions、add_images、add_audios 依次把四条轨道写进去，结束节点输出草稿 ID。 整条流水线的时间轴基准是配音时长：每段配音多长，对应的画面和字幕就排多长。想通这一点之后，整个工作流突然就不难懂了——文案每段写多长，直接决定了视频节奏。 智能体的最后一公里：四个现象和 Codex 排查实录 大脑跑通，输出草稿 ID，我以为结束了。结果从\"云端草稿\"到\"本地剪映能用的草稿\"这最后一公里，走了一下午。 先声明：我不确定这些是插件的 bug 还是我自己的配置问题，只是把现象、排查过程和最后的解决办法记下来。有对米核客户端、剪映小助手比较熟悉的朋友，欢迎指导。 现象一：米核 App 下载不了自己的草稿 剪映小助手 App 点下载，转圈几秒后报\"下载失败链接\"。一开始以为要充值。后来用 Codex 查了网络请求，发现草稿数据本身是公开接口，https:\u002F\u002Fmiheai.com\u002Fplugin\u002Fdraft\u002F草稿ID 直接返回完整 JSON，素材链接用 curl 跟随跳转就能下。可能是 App 下载器对某类签名链接的处理有问题，也可能是我账号哪里没弄对——总之绕过 App 直接拉数据，问题就解决了。 现象二：字幕轨有内容，画面里看不到 草稿打开，字幕轨明明有内容，播放器里就是没有字。 Codex 对比了我的草稿和正常草稿，发现轨道数组的顺序不一样：我这个把字幕夹在了视频轨中间。剪映的规则是数组靠后、层级靠上，字幕被上面的视频轨盖住了。把字幕轨挪到所有视频轨之后，字就露出来了。 现象三：字幕变成白框，字是透明的 层级调好后，选中字幕，画面里只有一个白色线框，字没了。 这一步查得最久。Codex 把正常草稿的字幕素材和我的逐字段对比，发现我的字幕素材里塞了 60 多个字段，正常草稿只有 12 个；而且填充色缺了透明度字段，背景色为空但背景不透明度是 1。把这些素材按正常草稿的精简结构重建，只保留文字、颜色、字号、位置，白框消失，字也出来了。 现象四：改了字幕颜色不生效 工作流里把字幕颜色从红色改成米黄色（f9f3c4），重跑，装进去一看，还是旧的棕色。 Codex 对比发现：素材顶层 text_color 是新颜色没错，但正文样式里写的还是旧颜色，两处数据不一致，而剪映渲染认的是正文样式。以顶层颜色为准覆盖过去，就对了。 这四个问题修完后，我让 Codex 把整个\"拉草稿、下素材、修结构、装进剪映\"的过程封装成了一个技能。现在链路变成：扣子跑完出 ID，技能一条命令装好。到这一步，这个智能体才算真正能干活了。 说实话，没有 Codex 这种能直接读草稿文件、逐字段对比的工具，光靠肉眼在剪映界面上点，我可能到现在还在猜。 add_captions 参数（我的最终配置） 字幕样式全在这个节点的参数里，这是我调到最后能正常显示的组合： 参数 我的填法 说明 alpha 1 不透明度，别空着 text_color f9f3c4 填充色，以这个顶层参数为准 border_color 和文字同色或对比色 默认 dad1cf 是浅灰白，容易出\"白框\"观感；同色相当于加粗 font_size 6 2560 宽画布上 6 号够看 transform_x 0 水平居中 transform_y -1000 重点，见下 transform_y 这个参数我来回试了好多次才对。实际测下来的规律是：剪映里显示的位置大约只有填值的一半。画布高 1440，想让字幕在画面中心往下 500 像素，得填 -1000。不知道是我理解错了单位，还是插件和剪映的换算本来就不一致——反正按 2 倍填，位置就是准的。 视频生成节点的三个体会 时长：节点可选 5 秒或 10 秒。配音段长度是文案决定的，我这个工作流每段配音 5.4 到 14.9 秒不等，5 秒的视频盖不住长段。选 10 秒，同时把文案每段尽量控制在 10 秒内。 分辨率：节点选的是 1080P，实际出片只有 864×480，放到 2K 画布上会糊。不知道是不是我套餐或模型限制，有懂的朋友可以说说。 提示词：默认只接分镜描述，生成的视频动作幅度很小，\"动了跟没动一样\"。想要动感，提示词里得加动作和运镜，比如\"兔子快速奔跑，镜头侧面跟随\"。 验证智能体是否真的能干活（我的检查清单） 工作流跑完，结束节点输出草稿 ID； 浏览器打开 https:\u002F\u002Fmiheai.com\u002Fplugin\u002Fdraft\u002F草稿ID，能看到完整 JSON，说明云端草稿正常； 装进剪映后查三件事：视频轨在字幕轨下面、字幕颜色字号和工作流设置一致、总时长等于各段配音之和； 按空格播放，画面动、字幕跟着配音走，收工。 老张心得 第一次搭视频智能体，最大的体会是：智能体不是搭个聊天框接个大模型就完事——工作流只是它的大脑，大脑到产出之间还隔着一整条工具链。 网上大部分教程教的是\"大脑怎么思考\"，没人教\"手脚怎么落地\"。而真实世界里，卡住你的恰恰是那些没人讲的环节。 还有一条：结构化数据出问题，别在界面上瞎点，把文件打开逐字段对比，比什么都快。这次全靠 Codex 干这个活。 最后再说一遍：上面四个现象，到底是插件的问题还是我配置的问题，我没完全搞清楚。有对米核客户端、剪映小助手比较熟悉的朋友，欢迎指导，评论区等你。 互动话题 你搭的第一个智能体是干什么的？跑通之后，卡在了哪个\"最后一公里\"？ 你觉得\"能聊天\"和\"能干活\"的智能体，差别到底在哪？ 关注老张 公众号：老张聊运维 小程序：观简国学 个人博客：https:\u002F\u002Fwww.shanwaiyun.top\u002F",3318,{"id":6,"kind":7,"title":11,"summary":13,"image":14,"href":16,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":40},"2026 · 人工智能","#2563eb","16 \u002F 10",[19],{"targetType":8,"targetId":9,"likedByMe":42,"likeCount":43,"commentCount":43,"contentLikeCount":43,"contentCommentCount":43,"sourceLikeCount":43,"sourceCommentCount":43},false,0,[45,52,59,66,73,80,86,93],{"id":46,"kind":7,"title":47,"summary":48,"image":49,"href":50,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":51},"NEWS_ARTICLE:930","基于 vLLM+Nginx 构建负载均衡推理集群","企业内部私有环境部署大模型推理集群时，很容易遇到流量调度混乱、节点负载失衡、会话上下文丢失、接口缺少鉴权防护等一系列问题，单 vLLM 推理节点难以支撑并发请求。本文基于 Ubuntu 22.04 系统环境，搭建 Nginx + vLLM-Semantic-Router + vLLM-Router","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F1379525\u002F202609\u002F1379525-20260910165534385-2022408098.png","\u002Fnews\u002F930",[19],{"id":53,"kind":7,"title":54,"summary":55,"image":56,"href":57,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":58},"NEWS_ARTICLE:932","2026年AI编程工具大全，33个主流工具一次看懂","事情是这样的，前两天看到一张图，是某个社区官网的「支持的工具」清单，我数了数，整整31个AI编程工具。 两年前这份清单撑死5个，现在直接31个，而且我居然每一个都认识。。。 干脆整理成一篇，顺手把最近字节的TraeWork和豆包工作也补了进来，凑成33个。 今天给大家推荐一遍，每个工具说说它是干什么","https:\u002F\u002Fimage.kjdaohang.com\u002Fimg\u002F20260909210838518.png","\u002Fnews\u002F932",[19],{"id":60,"kind":7,"title":61,"summary":62,"image":63,"href":64,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":65},"NEWS_ARTICLE:935","[Agent Memory \u002F 强化学习] MemPO源码学习笔记 ---（1）--- 总体","[Agent Memory \u002F 强化学习] MemPO源码学习笔记 （1） 总体 目录[Agent Memory \u002F 强化学习] MemPO源码学习笔记 （1） 总体0x00 概要0x01 基础 &amp; 背景1.1 用RL训练记忆系统的要点1.2 主要难点1.3 主要思路1.4 RL训练方案1.","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F1850883\u002F202609\u002F1850883-20260906190854637-986949885.jpg","\u002Fnews\u002F935",[19],{"id":67,"kind":7,"title":68,"summary":69,"image":70,"href":71,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":72},"NEWS_ARTICLE:940","LLama-Factory 实现大模型LoRA-SFT微调指南","LLaMA Factory 是一款开源、低代码、一站式大语言与多模态模型微调框架，用于降低大模型的微调落地门槛。框架兼容 Qwen、LLaMA、ChatGLM、LLaVA 等上百款主流开源模型，支持增量预训练、SFT 监督微调、DPO、KTO、ORPO 等多种训练对齐方案，原生集成 LoRA、QLo","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F1379525\u002F202609\u002F1379525-20260909140111199-832484524.png","\u002Fnews\u002F940",[19],{"id":74,"kind":7,"title":75,"summary":76,"image":77,"href":78,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":79},"NEWS_ARTICLE:950","每天白嫖 WorkBuddy 100 积分，我让WorkBuddy自己领","有没有小伙伴跟我一样，每天都去白嫖 WorkBuddy 的 100 积分，每天都怕忘记领。 其实我早就开了会员，但还是会有积分焦虑，天天惦记着今天的积分领没领。后来我发现 WorkBuddy 可以自己领积分，今天把这个技能分享给小伙伴们。 Buddy 加油站每天签到领 100 积分，连续签满 7 天","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F2381533\u002F202609\u002F2381533-20260910080820041-1607850292.png","\u002Fnews\u002F950",[19],{"id":81,"kind":7,"title":82,"summary":83,"image":15,"href":84,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":85},"NEWS_ARTICLE:949","AI知识库，是捷径吗？","从信息化到数字化，再到当下的智能化，技术进步带来的效率提升，如果往好处想应该是：节省更多的时间和成本，用来做更多的事情。但从现实的角度看，节流比开源来得容易。","\u002Fnews\u002F949",[19],{"id":87,"kind":7,"title":88,"summary":89,"image":90,"href":91,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":92},"NEWS_ARTICLE:977","【OpenClaw具身硬件】ZeroClaw 源码阅读笔记（4）--- 代码执行","【OpenClaw具身硬件】ZeroClaw 源码阅读笔记（4） 代码执行 目录【OpenClaw具身硬件】ZeroClaw 源码阅读笔记（4） 代码执行0x00 概要0x01 代码合成1.1 核心思想1.2 业务逻辑具体应用场景能力体现1.3 实现细节生成种类Rust 代码Arduino CLI的","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F1850883\u002F202608\u002F1850883-20260823212850242-1723558087.png","\u002Fnews\u002F977",[19],{"id":94,"kind":7,"title":95,"summary":96,"image":97,"href":98,"meta":37,"badge":10,"author":12,"stats":-1,"accent":38,"coverRatio":39,"tags":99},"NEWS_ARTICLE:985","机器学习项目：客户分群——K-Means 聚类从选参到业务画像的完整实战","商场用户分群： 一、前言 在商场运营中，面对成千上万的顾客，如果用同一套营销策略对待所有人，效果往往事倍功半。高收入的中年人和月光族的年轻人等等群体，消费习惯和偏好截然不同——这就需要用户分群（Customer Segmentation）：根据用户的年龄、收入、消费行为等特征，将相似的用户归为一类，","https:\u002F\u002Fimg2024.cnblogs.com\u002Fblog\u002F3775135\u002F202609\u002F3775135-20260908154332888-1132576367.png","\u002Fnews\u002F985",[19]]