V2EX = way to explore
V2EX 是一个关于分享和探索的地方
Sign Up Now
For Existing Member  Sign In
V2EX  ›  bkingfilm  ›  全部回复第 1 页 / 共 2 页
回复总数  23
1  2  
@0x2CA 补个可能的原因,片源是不是 HEVC/H.265 或者 10bit 的?这类编码 Chrome 读得到时长和分辨率,画面解不出来,抽出来就是一张张纯黑,全程还不报错,AV1 也一样。

确认起来简单,把那个文件直接拖进浏览器打开,有声音但画面全黑就是它。换一个 H.264 的 MP4 再试试,在线版没带转码,本地跑的那版才能转。
@0x2CA 我这是正常的,你那发生了什么问题
@Chicagoake 老观众了,🙏感谢
@OctopusGO 这就是一个对电影进行反编译的工具,可以把一部电影自动还原成剧本,方便学习电影制作的人进行理解,以前拉片这个动作只能手动完成,需要消耗大量的时间,这个工具就是用来节省时间的
@cirzear gap year 刚好碰上 AI 爆发,很感兴趣就随手做些小玩具,当做学习作业了
@ETiV 啊?是哪位,快来亮明身份
@Chicagoake 是我本人啊,嘿嘿
@lame_chen 就是把一部电影拆开看。导进去抽帧加字幕丢给 AI ,出一条分段的时间轴和结构树,每段在讲什么、情绪走到哪都标出来,然后自己边看边往上面记笔记。写剧本的、剪片子的、影视专业交拉片作业的会用得上。

@ButcherHu 1 秒是写死的,界面上没做成可调。压住它的是包体积,320 宽单张 10KB ,两小时片七千多帧,AI 包已经 70MB ,ChatGPT 免费版传上去就到顶了,改成半秒直接翻倍。另一头是 AI 只拆到幕和场,一个镜头几秒,1 秒一帧基本每个镜头都能中一张,再密多出来的全是同镜头的重复帧,体积涨信息不涨。代价是快切段落会漏镜头,想做镜头级统计的话这个密度不够。
他那批教程到现在还是搜 ffmpeg 中文资料排在最前面的一批,坑在代码停在 2.x 时代。avcodec_decode_video2 那套解码接口 3.1 就被 send_packet 加 receive_frame 取代了,5.0 直接删掉,照着抄现在编不过。

流程图和讲解还是有用的,代码部分得自己按新接口重写一遍。新人容易卡在这儿,以为是自己环境的问题。
装第三方输入法最常收到的两类报障其实都不在输入法本身,可以提前挡一下。

一是开机后图标在但打不出字。ctfmon 和输入法抢开机那几秒,连接建立失败之后不会重连,重启输入法进程没用,得重启 ctfmon 和 TextInputHost 。取消开机密码走自动登录的机器最容易中,少了输密码那几十秒缓冲。

二是 Ctrl+Space 突然没反应只剩 Win+Space 。Windows 会自己往语言列表塞一个独立的英语(美国)布局并排到 Preload 第一位,开机停在英文布局上,中文 IME 开关就没东西可切了。用户基本都会当成你的输入法坏了。
导出 SRT 那条建议看下时间戳的精度。Whisper 原生给的是句级时间戳,一句话越长偏得越多,十几秒一句的开头能差半秒以上,拿去当字幕跟画面对不上。上一层强制对齐拿到词级时间戳会准很多。

另一个坑是静音段的幻觉。长时间没人说话的地方 Whisper 会自己编一句出来,最常见的就是片尾冒出感谢观看那种字。先过一遍 VAD 把静音切掉再喂进去,能少掉大半。
对。不是站上标错了,是取流的时候挑错了档。X 一条视频会给出好几个分辨率的地址,mp4 那组按码率排开,m3u8 的 master 里也是列一串,直接取第一条很容易拿到 480 那档。

验证很好办,同一条推下下来看文件的实际分辨率,再跟 X 网页版全屏的清晰度对一下。另外刚发出来的推还没转完码,那会儿确实只有低档能拿,过十几分钟再抓就有高的了。
下 X 的视频最容易翻车的是清晰度。同一条视频的 m3u8 里有好几档码率,不少下载站默认取列表第一条,1080 的片子拿下来是 480,放大一看就糊。给个清晰度选择,或者干脆固定取最高那档。

另外一条推带多个视频的情况,还有引用推里的那条,常见工具只抓第一个,这块可以测一下。
npm 上查了下,@anthropic-ai/claude-code 最后一次发包是 2.1.220,北京时间 7 月 25 号早上七点多,到今天正好一周,不是 changelog 漏写。

另外这个包有两个 tag,latest 是 2.1.220,stable 还停在 2.1.212(7 月 16 号)。装的时候走的通道不一样,看到的版本能差八个号,对不上很正常。
单目深度是逐帧独立估的,每帧各自归一化。镜头一推近或者背景一换,整张图的明暗基准就跳一下。人眼看着还行,喂给视频模型就是忽远忽近地抖。加一层时序平滑,或者直接换视频版的深度模型,会稳很多。

另外只给深度,换人的时候手最容易崩。肢体一交叠那块深度图就糊成一坨。再叠一层姿态骨架一起喂,手和脚的还原率高不少。
30 张纵向拼很容易撞浏览器的 canvas 上限。Chrome 那边大概两亿多像素封顶,iOS Safari 还要低一截,超了不报错,toBlob 直接给你空白图或者 null,用户只会以为是工具坏了。

建议预览阶段就把最终画布尺寸算出来摆在界面上,超限自动降采样或者分段导出。长截图那种细长比例最容易中招。
找回别人删的内容之外,建议加个反向的功能,贴自己的帖子链接,告诉我匿名状态下这帖还在不在。被 automod 静默移除的时候,自己登录着看一切正常,开个无痕窗口就是 404,新号在陌生版块发帖踩这个特别多。

另外数据源是哪个?Pushshift 对普通用户关掉之后,这类站的覆盖率和能回溯的时间差别很大,小版块收不收得全基本决定了能不能用。
这种缝合能不能立,看第一人称那半边单拎出来能不能玩几十小时。骑砍立得住是因为砍人本身耐玩,大地图只是给它找理由。

常见的翻车是射击层做成经营层的奖励关,前几小时新鲜,后面就只剩管殖民地那半边了。序章里肉鸽跑一局大概多长,死了掉什么?
晕 3D 多半不是帧率,是相机跟着转。原版 Hole.io 视角压得很低而且几乎不转,地面参照系一直稳着,玩一局眼睛不难受。

把相机转向那段去掉只留位移跟随,再把吞东西时的下沉放慢点,晕感能去掉大半。
7 月 30 日
回复了 AlisaQian 创建的主题 分享创造 分享一个一键生成拼贴风视频的开源 Skill
这类一键流水线最后翻车基本都在切点上。按字幕时间码切镜头,句尾那段拖音会被算进去,出来常常带一格残帧或者半个尾音。

出点往前找最近的静音帧再切,能省掉人工一条条回看。
1  2  
About   ·   Help   ·   Advertise   ·   Blog   ·   API   ·   FAQ   ·   Solana   ·   3988 Online   Highest 6679   ·     Select Language
创意工作者们的社区
World is powered by solitude
VERSION: 3.9.8.5 · 53ms · UTC 05:19 · PVG 13:19 · LAX 22:19 · JFK 01:19
♥ Do have faith in what you're doing.