AI “nuốt chửng” sách: Cơn khát dữ liệu hủy hoại và tác động IT của bạn

AI đang “ăn thịt” hàng triệu cuốn sách giấy: Góc nhìn kỹ thuật về cơn khát dữ liệu và hệ lụy cho hạ tầng IT của bạn

AI đang phát triển chóng mặt, thay đổi gần như mọi ngóc ngách cuộc sống của chúng ta. Thế nhưng, ít ai nghĩ rằng “bữa ăn” của các mô hình trí tuệ nhân tạo lại đang ngốn sạch hàng triệu cuốn sách giấy, hủy hoại một phần di sản tri thức của nhân loại. Đây không chỉ là một vấn đề đạo đức gây tranh cãi, mà còn cho thấy rõ cơn khát dữ liệu chất lượng cao của AI và những tác động không hề nhỏ đến hạ tầng IT của bạn, từ các trung tâm dữ liệu khổng lồ đến chiếc máy tính cá nhân hàng ngày.

Đằng sau câu chuyện này là áp lực khổng lồ lên tài nguyên dữ liệu, từ khâu thu thập đến xử lý và lưu trữ, đòi hỏi khả năng tính toán vượt trội. Những yếu tố này quyết định sự ổn định và hiệu suất của mọi hệ thống máy tính. Nắm rõ quy trình và những hệ lụy này sẽ giúp bạn hiểu vì sao việc duy trì một hệ thống IT bền bỉ, hiệu quả lại quan trọng đến thế.

Cơn khát “Dữ liệu sạch” của AI và Giá trị của Sách giấy

Các mô hình AI hiện đại, đặc biệt là các mô hình ngôn ngữ lớn (LLM), đòi hỏi một lượng dữ liệu khổng lồ để huấn luyện. Tuy nhiên, không phải dữ liệu nào cũng hữu ích. Trên internet hiện tại, “AI slop” – những nội dung kém chất lượng, lặp đi lặp lại hay sai lệch do chính AI tạo ra – đang tràn lan, làm ô nhiễm nghiêm trọng nguồn dữ liệu công khai. Điều này khiến việc huấn luyện AI trở nên kém hiệu quả và dễ dẫn đến các mô hình đưa ra thông tin sai lệch.

Trước tình hình đó, các công ty AI đang gấp rút tìm kiếm các nguồn dữ liệu “sạch” và chất lượng cao, đặc biệt là những dữ liệu được tạo ra bởi con người trước năm 2022. Lý do là dữ liệu từ giai đoạn này ít bị ảnh hưởng bởi “AI slop” và phản ánh chân thực hơn tri thức, phong cách viết của con người. Trong cuộc săn tìm dữ liệu “sạch” này, sách giấy bỗng trở thành một kho báu vô giá. Mỗi cuốn sách là một tác phẩm được biên soạn, kiểm duyệt kỹ lưỡng, chứa đựng kiến thức chuyên sâu và đa dạng.

Về mặt kỹ thuật, việc tìm kiếm và phân loại nguồn dữ liệu này không hề đơn giản. Các công ty AI thường sử dụng các cơ sở dữ liệu trung gian như ISBNdb, một kho lưu trữ thông tin về hơn 111 triệu cuốn sách với mã số ISBN duy nhất. Điều này cho thấy đây không phải là chuyện mua lẻ vài cuốn sách, mà là một chiến dịch thu thập dữ liệu cực kỳ có tổ chức, quy mô lớn, nhằm “quét sạch” kho tàng tri thức giấy.

Quy trình “Số hóa và Hủy bỏ” quy mô lớn

Thực tế đáng lo ngại này được hé lộ qua một báo cáo điều tra sâu rộng từ 404 Media. Báo cáo tiết lộ các công ty AI đang âm thầm mua sỉ hàng triệu cuốn sách cũ thông qua các nhà môi giới. Các đơn hàng có thể lên đến hàng ngàn, thậm chí một triệu cuốn trong một giao dịch, cho thấy nhu cầu cấp bách và quy mô chưa từng có.

Nghe qua quy trình này, hẳn nhiều người sẽ thấy sốc:

  • Các nhà sách cũ ghi nhận doanh số bán hàng tăng vọt đột biến, có nơi doanh thu tăng gấp 5 lần so với bình thường, chủ yếu đến từ các đơn hàng lớn bất thường.
  • Việc mua bán không theo chủ đề, thể loại hay tác giả cụ thể nào. Tiêu chí duy nhất là sách phải có mã ISBN để dễ dàng định danh và phân loại số hóa, và giá cả dường như không phải là yếu tố quá quan trọng.
  • Sau khi thu mua, các công ty này sử dụng dịch vụ quét tài liệu chuyên nghiệp. Phương pháp được ưu tiên là “quét phá hủy” (destructive scanning). Với phương pháp này, cuốn sách sẽ bị xé rời gáy, từng trang được đưa vào máy quét công nghiệp tốc độ cao. Mục tiêu là tối ưu hóa hiệu quả và giảm thiểu chi phí trên từng trang giấy.

Kết quả là hàng triệu cuốn sách bị phá hủy hoàn toàn sau khi được số hóa. Mục đích duy nhất của chúng là phục vụ việc huấn luyện AI, cung cấp nguồn dữ liệu thô để các mô hình học hỏi và phát triển. Đây là một quy trình nhanh chóng, triệt để, nhưng cũng kéo theo không ít hệ lụy.

Hệ lụy: Đạo đức, Bản quyền và Rủi ro “Khóa” tri thức

Việc số hóa hàng loạt sách rồi hủy bỏ chúng đang gây ra những tranh cãi gay gắt về đạo đức. Câu hỏi đặt ra là liệu các cuốn sách quý hiếm, đã ngừng in hoặc những ấn phẩm có giá trị lịch sử có được lọc ra khỏi quy trình này hay không. Việc mất đi bản gốc vật lý có thể đồng nghĩa với việc mất đi một phần di sản văn hóa không thể phục hồi.

Bên cạnh đó, vấn đề bản quyền trở nên đặc biệt phức tạp:

  • Hãy nhìn vào vụ kiện của Anthropic làm ví dụ. Dù tòa án đã phán quyết rằng việc sử dụng sách để huấn luyện AI có thể được coi là “sử dụng hợp lý” (fair use) theo luật bản quyền, Anthropic vẫn phải đối mặt với khoản phạt 1.5 tỷ USD vì hành vi lưu giữ một thư viện kỹ thuật số chứa 7 triệu cuốn sách vi phạm bản quyền. Điều này cho thấy ranh giới pháp lý giữa việc sử dụng dữ liệu để huấn luyện và việc lưu trữ nội dung có bản quyền là rất mong manh.
  • Ngay cả Google, gã khổng lồ công nghệ, cũng không tránh khỏi các rắc rối pháp lý khi bị kiện bởi các nhà xuất bản hàng đầu. Họ bị cáo buộc sử dụng hàng triệu cuốn sách có bản quyền để phát triển mô hình AI Gemini mà không có sự cho phép hay đền bù thỏa đáng.

Một rủi ro lớn khác là khả năng “khóa” tri thức. Dữ liệu từ hàng triệu cuốn sách được số hóa sẽ không được công khai mà bị “khóa” trong các cơ sở dữ liệu riêng của các công ty AI. Điều này tạo ra một kho tri thức độc quyền, không dễ dàng tiếp cận cho cộng đồng, giới nghiên cứu hay các thế hệ tương lai. Thay vì trở thành một phần của di sản số hóa mở, tri thức này có thể chỉ phục vụ lợi ích của một số ít tập đoàn, tiềm ẩn nguy cơ làm suy yếu sự bình đẳng trong tiếp cận thông tin và kiến thức.

Đảm bảo hệ thống IT bền bỉ – Nền tảng cho mọi tri thức

Cơn khát dữ liệu không đáy của AI không chỉ tạo ra những thách thức lớn về đạo đức, pháp lý và bảo tồn tri thức nhân loại, mà còn cho thấy tầm quan trọng của một hạ tầng IT đủ mạnh. Nơi mà sự ổn định của hệ thống dữ liệu, khả năng kết nối và cung cấp năng lượng phải luôn là yếu tố sống còn. Dù là cho các siêu máy tính huấn luyện AI hay cho một người dùng văn phòng thông thường như chúng ta, một hệ thống máy tính vẫn cần “dinh dưỡng” tốt nhất để hoạt động hiệu quả và bền bỉ.

Tương tự như cách các công ty AI cần dữ liệu “sạch” để vận hành tối ưu, hệ thống máy tính của bạn cũng cần những linh kiện chất lượng cao để đảm bảo mọi kết nối dữ liệu và nguồn điện luôn ổn định. Việc này giúp tránh các sự cố gián đoạn không đáng có, ảnh hưởng đến công việc hay quá trình xử lý thông tin quan trọng. Từ một bộ phim giải trí cho đến một dự án lớn, mọi thứ đều cần được vận hành một cách trơn tru.

Để đảm bảo hệ thống của bạn luôn vận hành trơn tru, cung cấp năng lượng đầy đủ và kết nối tín hiệu sắc nét, hãy ghé thăm Kho sỉ Phụ kiện. Chúng tôi tự hào cung cấp các giải pháp kết nối màn hình chất lượng cao như cáp HDMI “xịn”, cáp VGA bền bỉ cho màn hình cũ hay đầu chuyển DVI tương thích, đảm bảo hình ảnh hiển thị sắc nét và ổn định. Đồng thời, các loại dây nguồn SATA/IDE của chúng tôi được thiết kế để cung cấp đủ tải, giúp các ổ cứng và linh kiện khác hoạt động an toàn và bền bỉ. Với Kho Sỉ Phụ Kiện, bạn có thể hoàn toàn yên tâm về một hệ thống máy tính tối ưu và đáng tin cậy.


#AI, #DuLieuSach, #SachGiay, #HaTangIT, #BanQuyen

Biên dịch và tổng hợp từ Website Tomshardware.com: Link bài viết

Bài viết liên quan
preloader