Amazon компани хиймэл оюун ухааны загвараа сургахын тулд ховор номнуудыг устгаж байна

Published:

Энэхүү мэдээ, нийтлэлийг хиймэл оюун боловсруулав.

Технологийн аварга компани хиймэл оюун ухааны сургалтын мэдээллийн сан бүрдүүлэхийн тулд хэвлэлээс гарсан ховор номнуудыг худалдан авч, задалж ашиглаж байгаа нь тогтоогджээ

404 Media-гийн хийсэн мөрдлөгөөр Amazon-ы Лас Вегас дахь VGT3 байгууламж руу ховор номнуудын ачилт ирж байгааг илрүүлсэн байна. Тус байгууламж нь ном барьсан үлэг гүрвэлийн дүрс бүхий тэмдэг ашигладаг бөгөөд Amazon-ы зүгээс үйлчлүүлэгчдийн ашигладаг бүтээгдэхүүн, үйлчилгээг сайжруулах зорилгоор худалдааны сувгуудаар дамжуулан ном худалдан авдаг гэж мэдэгджээ.

Том хэлний загваруудыг (LLM) сургахад асар их хэмжээний текст шаардлагатай байдаг тул компаниуд интернэт дэх мэдээллийн нөөцийг бүрэн ашиглаж дуусч байна. Өмнө нь Anthropic компани зохиогчийн эрхтэй номнуудыг хууль бусаар ашигласан хэрэг гарч байсан бол одоо интернэтээс олдох боломжгүй, хэвлэлээс гарсан ховор номнууд нь сургалтын мэдээллийн шинэ эх үүсвэр болоод байна.

2022 оноос өмнө хэвлэгдсэн эдгээр номнууд нь хиймэл оюун ухаанаар бичигдээгүй гэдгээрээ онцгой үнэ цэнтэй юм. Хиймэл оюун ухаан өөрөө өөрийнхөө бүтээсэн контентыг сургалтад ашиглах нь загварын чанар муудаж, алдаа гаргахад хүргэдэг “загварын сүйрэл” (model collapse) гэх эрсдэлийг дагуулдаг байна.

Дэлгэрэнгүйг эх сурвалжаас харах

↓Эх сурвалжийг нээх ↓

Amazon is buying tons of rare books, cutting off their spines, and scanning them for AI training, according to 404 Media, which placed a tracking device in a rare book that ultimately arrived at an Amazon facility in Las Vegas.

The facility, known as VGT3, identifies itself with a symbol of a dinosaur holding a book in its claws. Amazon told 404 Media in a statement that it “purchases books through commercial channels to improve the products and services customers use.”

Companies like Amazon need unfathomably large amounts of text to train their LLMs, which have already ingested what they can from the internet (and, in Anthropic’s case, illegally pirated books). Rare books, especially ones that are out of print or impossible to find on the internet, offer a new source of coveted training data.

These texts are especially valuable since there’s no chance that anything published before 2022 was written by an LLM. When LLMs train on AI-generated text, they risk “model collapse,” which can occur when the quality of an LLM’s outputs degrade after ingesting too much AI-generated text.

- Зар сурталчилгаа -

Та юу гэж бодож байна?

Сэтгэгдлээ оруулна уу!
Please enter your name here

MFC.mn сайтад сэтгэгдэл оруулахад анхаарах зүйлс

Холбоотой

spot_img

Шинэ

spot_img