AI đi làm tháng 9/2026: agent bắt đầu chạy việc thật, còn con người giữ quyền duyệt

Từ agent có sandbox đến coding assistant chạy song song và lớp routing theo khu vực, thay đổi lớn nhất của tháng 9 không phải model mới mà là cách giao việc cho AI. Đây là các tín hiệu đáng thử trước khi đưa vào công việc hằng ngày.

Nếu bản tin AI cuối tháng 8 còn xoay quanh model nào nhanh hơn, rẻ hơn, thì tháng 9 có một dịch chuyển thực tế hơn nhiều: các công cụ đang học cách nhận một mẩu việc, tự chạy trong môi trường có kiểm soát rồi trả về thứ để người dùng duyệt. Nó không biến AI thành nhân viên tự quyết. Nhưng nó thay đổi đáng kể cách một người làm sản phẩm, viết nội dung, phân tích dữ liệu hay sửa code tổ chức một ngày làm việc.

Điều đã xác nhận đầu tiên là OpenAI đã công bố Agents API ở public beta ngày 10/9. Điểm đáng chú ý không chỉ là thêm một API gọi model. OpenAI đóng gói luôn harness điều phối agent, cho phép chọn sandbox do họ vận hành, hạ tầng của chính đội ngũ hoặc đối tác sandbox. Với công việc hằng ngày, đây là lời hứa về một lớp chạy việc có sẵn: agent có thể dùng tool, làm việc với file và trả lại artifact thay vì dừng ở một đoạn chat đẹp mắt.

Ý nghĩa thực dụng là người dùng nên tách công việc thành đơn vị có đầu vào, đầu ra và điểm duyệt rõ ràng. Ví dụ: nhận 20 phản hồi khách hàng, nhóm vấn đề, đối chiếu với tài liệu sản phẩm và tạo bản nháp changelog. Agent có thể làm phần thu thập và sắp xếp; người phụ trách vẫn xác nhận kết luận, quyền truy cập và thao tác cuối. Khi giới hạn được đặt từ đầu, AI hữu ích hơn hẳn kiểu giao lệnh chung chung “xử lý giúp tôi”.

Mặt trận coding cũng đang đổi từ “một copilot trong editor” sang bảng điều phối công việc. GitHub mô tả cách chạy nhiều agent độc lập trên các Git worktree; sau đó Copilot bổ sung ba mức tự chọn model theo ưu tiên chi phí, cân bằng hoặc chất lượng, cùng GPT-6 Sol và Luna cho các nhịp việc khác nhau. Đây là thay đổi đáng kể hơn một model picker: cùng một bug có thể được giao cho luồng rẻ để khoanh vùng, luồng cân bằng để sửa và luồng kỹ hơn để đánh giá rủi ro. Bản weekly release cũng cho thấy code review đã biết dùng shell để kiểm tra thay đổi và tổng hợp nhận xét từ nhiều agent nhẹ.

Điều này kéo theo một thói quen mới: đừng chỉ đo “AI viết được bao nhiêu dòng code”. Hãy đo thời gian từ issue đến pull request có test, tỷ lệ test qua ở lần đầu, số nhận xét còn mở sau review và chi phí mỗi thay đổi đã được chấp nhận. Worktree riêng giúp các luồng không đạp lên nhau, nhưng không thay thế việc chia nhỏ phạm vi. Một agent sửa accessibility, một agent lần dấu lỗi và một agent chạy regression test là tổ hợp lành mạnh hơn ba agent cùng sửa một file.

Về model access, Google đã ra mắt Gemini 3.8 Flash ngày 2/9, định vị là model workhorse tốt hơn cho engineering, tác vụ agent nhiều bước và reasoning chuyên môn, trong khi giữ giá giới thiệu $0,75 input và $3,75 output cho mỗi triệu token như 3.7 Flash. Với nhóm nhỏ, tín hiệu quan trọng là năng lực agent đang đi xuống tier “flash”, nơi độ trễ và hóa đơn phù hợp hơn để thử luồng vận hành thường ngày, không chỉ dành cho một demo đắt tiền.

Routing cũng bớt là chuyện của đội hạ tầng thuần túy. OpenRouter đã đưa endpoint US in-region vào hoạt động ngày 9/9, bên cạnh EU, để request chỉ được giải mã và phục vụ trong khu vực đã chọn. Tài liệu của họ cũng mô tả alias latest tự chuyển sang model mới nhất trong một họ model. Hai ý này nghe kỹ thuật, nhưng chạm thẳng vào công việc: một luồng dùng dữ liệu nhạy cảm cần ràng buộc khu vực; một prototype cần cập nhật nhanh; còn hệ thống cần kết quả lặp lại phải ghim model cụ thể và có bộ test hồi quy. Không có một cấu hình đúng cho tất cả.

Phần vẫn còn sớm cần nói thật rõ. Agents API đang là public beta, nên chưa nên là điểm duy nhất trong quy trình quan trọng. Gemini 3.8 Flash Cyber cũng chỉ được tiếp cận qua chương trình Fairwind dành cho trusted defenders, không phải công cụ phổ thông để ai cũng thử. Và “nhiều agent” không tự tạo ra chất lượng: nó làm chi phí, bề mặt quyền truy cập và lượng thứ cần review tăng lên. Thử nghiệm tốt là thử trên một luồng có thể rollback, có log và có người chịu trách nhiệm duyệt.

Góc đáng test 1: “Một ticket, ba agent, một pull request”. Lấy một bug thật nhưng nhỏ, chia ba vai trò: tái hiện lỗi, đề xuất bản vá và review kèm test. So sánh với một agent làm từ đầu đến cuối. Bài test này sẽ cho thấy worktree và phân vai có giảm thời gian review hay chỉ thêm tiếng ồn.

Góc đáng test 2: “Auto routing có thực sự rẻ hơn chọn model bằng tay?”. Chạy cùng một bộ 10 tác vụ gồm tóm tắt tài liệu, phân loại email, sửa bug và viết test; ghi lại model thực tế, token, thời gian và tỷ lệ đạt tiêu chí. Kết quả quan trọng không phải model nào thắng tuyệt đối mà là tác vụ nào nên được ghim model.

Góc đáng test 3: “Agent xử lý bản brief hằng ngày được đến đâu?”. Cho agent một brief 5 dòng, vài link nguồn và một thư mục tài liệu; yêu cầu nó lập kế hoạch, gom bằng chứng, viết bản nháp và nêu chỗ cần người xác nhận. Đây là use case gần với công việc marketing, nghiên cứu và vận hành hơn là màn trình diễn viết code.

Góc đáng test 4: “Latest hay pinned?”. Dùng một bộ prompt và dữ liệu mẫu, chạy mỗi ngày qua alias latest trong hai tuần rồi so với model version đã ghim. Nếu chất lượng nhảy vọt nhưng định dạng, chi phí hoặc kết quả regression trượt, bạn sẽ có bằng chứng rõ ràng để quyết định luồng nào được phép tự cập nhật.

Góc đáng test 5: “Bản đồ quyền của agent”. Liệt kê từng tool mà agent có thể đọc, ghi, gửi hoặc chạy; đặt quyền mặc định là chỉ đọc và thêm một điểm duyệt trước thao tác không thể đảo ngược. Bài này sẽ rất hữu ích cho đội nhỏ vì nó biến câu hỏi mơ hồ “có an toàn không?” thành checklist có thể kiểm tra.

Tháng 9 cho thấy cuộc đua AI đang rời khỏi cuộc thi chatbot. Lợi thế sẽ thuộc về người biết thiết kế một vòng lặp đơn giản: giao việc đủ hẹp, cấp đúng công cụ, giữ log, đo đầu ra và duyệt đúng chỗ. Model tốt hơn giúp vòng lặp ấy chạy nhanh hơn; workflow tốt mới biến nó thành công việc có thể tin được.

No comments yet