Khám phá Learn Stream About Jokes
COHORT 2 Foundation — Claude Code — 3 buổi Zoom · 21 · 24 · 28/07, 20:00 Đăng ký →
Bài viết

Tự động hoá hậu kỳ cho screen recording — tới đâu là hết

Dựng một screen recording tốn thời gian nhất ở khâu ít cần suy nghĩ nhất: cắt khoảng lặng, tua đoạn ngồi chờ, thêm zoom. Để máy làm hết phần đó, mình còn nguyên sức cho phần thật sự quyết định video hay hay dở.

Công cụ & Stack

Dựng một screen recording tốn thời gian nhất ở khâu ít cần suy nghĩ nhất: cắt khoảng lặng, tua đoạn ngồi chờ, thêm zoom. Nếu để máy làm hết phần đó, mình còn nguyên sức cho phần thật sự quyết định video hay hay dở.

Screen Studio chưa có MCP hay CLI chính thức để một AI agent tự edit video. Mà mình thì đang chuẩn bị cho chương trình Claude Code Foundation K3 — cần dựng một số lượng lớn video, không thể ngồi cắt tay từng cái. Nên mình đi tìm cách để agent làm giúp khâu nặng nhất mà lặp đi lặp lại.

Hoá ra làm được, và ranh giới “làm được tới đâu” mới là phần đáng nói.

Bài này nói gì

Trong hậu kỳ một screen recording có hai loại việc. Loại cơ học — cắt dead-air, tua đoạn chờ, mute, zoom cơ bản — chiếm nhiều thời gian mà gần như không cần đầu óc. Loại còn lại cần mình hiểu nội dung: nhấn mạnh chỗ nào, cắt đoạn nào, giữ nhịp ra sao.

Việc đáng làm là để máy nuốt trọn loại một, dồn sức cho loại hai. Mình để một AI agent làm khâu này, và bài viết là chuyện nó làm được tới đâu.

Phần ngốn thời gian nhất lại là phần dễ nhất. Một video hướng dẫn mười lăm phút có thể có ba bốn chục đoạn cần dọn: chỗ ngồi gõ, chỗ đợi trang load, chỗ rê chuột tìm nút, chỗ ngừng lại lấy hơi. Không đoạn nào khó xử lý. Chỉ là nhiều, và lặp.

Ngồi kéo tay từng đoạn mất một hai tiếng. Tệ hơn, làm xong thì mệt tới mức không còn muốn động vào phần còn lại — mà phần còn lại mới là phần làm video khác biệt.

Nên câu hỏi không phải “làm sao dựng nhanh hơn”. Câu hỏi là “phần nào giao được cho máy, phần nào phải giữ”.

Một AI agent chạy qua khâu dọn dead-air và thêm zoom cho recording

Máy làm được: phần cơ học. Đưa cho nó một bản recording, nó nghe audio, tìm những đoạn không có tiếng nói, rồi tự xử lý: tua nhanh những đoạn đó lên bốn lần, tắt tiếng chúng đi để không còn tiếng nền lộn xộn, và thêm zoom vào những lúc đang thao tác trên màn hình.

Đoạn ngồi chờ vẫn còn trong video, nên người xem không mất mạch. Nhưng nó lướt qua nhanh, im, gọn. Bản gốc không bị đụng tới — nếu không ưng, bỏ đi làm lại, footage vẫn nguyên.

Riêng zoom có một chỗ đáng nói. Cách thường làm là chọn một điểm để phóng to. Nhưng trong một đoạn, mình có thể click menu bên trái, mở popup ở giữa, rồi bấm nút ở góc phải — không có điểm cố định nào đúng cho cả đoạn. Cách gọn hơn là để zoom tự bám theo nơi mình đang click, di chuyển theo tay mình, thay vì đóng đinh vào một chỗ.

Bản edit: các điểm cắt, đoạn tua nhanh, hai khối zoom bám theo thao tác, và caption chạy dưới khung hình

Có một chỗ máy tưởng làm được nhưng chưa đủ. Nghe audio thì biết chỗ nào im lặng. Nhưng im lặng có nhiều nghĩa. Có khi đang suy nghĩ. Có khi đang chờ máy phản hồi. Có khi vừa nói hỏng và chuẩn bị nói lại từ đầu.

Máy chỉ nghe khoảng lặng thì không phân biệt được ba trường hợp này. Muốn biết, phải đọc lời đã nói.

Ví dụ thật: đầu video mình nói “chào mọi người, trong video này…” rồi khựng lại, rồi nói lại y hệt câu đó lần nữa. Nếu chỉ nhìn khoảng lặng, máy thấy một quãng nghỉ bình thường và giữ cả hai lần. Nhưng nếu đọc transcript, nó thấy hai câu trùng nhau — hiểu ra lần đầu là take hỏng, lần hai mới là bản giữ, và cắt sạch phần đầu.

Đây là ranh giới thật giữa những gì tự động được và những gì cần hiểu nội dung. Tìm khoảng trống là việc máy làm tốt. Hiểu một câu nói hỏng cần một tầng nữa — biết nội dung chứ không chỉ âm lượng.

Còn một thứ nhỏ nhưng khó chịu: phụ đề. Tính năng tạo phụ đề tự động thường sai tên riêng và thuật ngữ, nhất là tiếng Việt lẫn tiếng Anh. “bài” thành “bàn”, “tìm hiểu” thành “tiền hiểu”, “Cloud Code” thành “Closet”. Sai kiểu đó đọc lên là mất tin ngay. Chỗ này giao cho một công cụ nhận dạng giọng nói tốt hơn, rồi thay thẳng vào — không phải ngồi sửa từng dòng.

Phần không giao được cho máy. Chọn đúng chỗ để nhấn mạnh. Viết lại một câu giải thích cho gọn. Thêm một dòng chú thích ở đoạn dễ rối. Cắt hẳn một đoạn lan man mà không cách tua nào cứu được. Quyết định nhịp cả video — chỗ nào cho người xem thở, chỗ nào dồn.

Những việc này cần mình hiểu bài đang dạy gì. Máy không biết đoạn nào là đoạn quan trọng nhất. Nó không biết khán giả sẽ rối ở đâu.

Nhưng nếu máy đã nuốt hết phần cơ học, mình bước vào phần này với đầu óc còn tỉnh và thời gian còn nguyên — thay vì làm nốt cho xong. Đó mới là chỗ chất lượng video thật sự thay đổi.

Cách mình dựng cái này là một skill nhỏ chạy trong Claude Code. Ai muốn dùng thử, mình để cho Insiders ở đây: arealisticdreamer.com/members/resources

#ai #claude-code #screen-studio #video #hau-ky #solopreneur

Bài viết liên quan

Cho agent thảo luận để ra kết quả, đừng cho chúng nói chuyện tự do

idea

Nhiều người thích "cho mấy con agent nói chuyện với nhau". Nghe cũng hợp lý: một agent làm được việc, thì vài con ngồi trao đổi chắc sẽ làm tốt hơn. Nhưng nói chuyện tự do thường ra kết quả ba phải và thành một cái chợ.

Claude Code: chặn secret rò rỉ ở tầng hook, trước khi prompt rời máy

idea

Một Claude Code hook (UserPromptSubmit) có thể chặn API key bị paste nhầm trước khi nó lên provider. Nhưng cách 'auto-fix' phổ biến nhất — tự ghi secret vào .env — lại là sai lầm. Vậy khi lỡ paste một key ra ngoài, việc thật sự cần làm là gì?

0:00

Chia sẻ ảnh

Bắt đầu gõ để tìm kiếm...