Anthropic компанийн судлаачид хиймэл оюун ухааныг өөрийгөө хөгжүүлэх боломжийг туршиж эхэллээ

Published:

Энэхүү мэдээ, нийтлэлийг хиймэл оюун боловсруулав.

Автоматжуулсан судалгааны систем нь хиймэл оюун ухааны загваруудын гүйцэтгэлийг хүний оролцоогүйгээр сайжруулах боломжтойг тус компанийн тайлан харууллаа

Баасан гарагт Anthropic компани “Автоматжуулсан судлаачид хиймэл оюун ухааны нийцлийн алдааг найдвартай засварлах боломжтой” нэртэй судалгааны өгүүллийг нийтэллээ. Чэнь Юэ-Хань тэргүүтэй судлаачдын баг хиймэл оюун ухааны системүүд нийцлийн 10 төрлийн хэмжүүр дээр өөрийн гүйцэтгэлийг чанарын алдагдалгүйгээр хэрхэн сайжруулж болохыг практик дээр харуулсан байна.

Уг систем нь уламжлалт судалгааны аргачлалыг дуурайлган ажилладаг бөгөөд холбогдох материалыг хайх, аргачлал санал болгох, загварыг давтамжтайгаар сургах дарааллаар явагддаг. Үр дүнтэй аргачлалыг хадгалж, үр дүнгүйг нь устгах замаар уг систем нь хурдан бөгөөд өргөн хүрээнд ажиллах чадвартай болохыг судалгаанд дурджээ.

Судалгааны үр дүнгээс үзэхэд, Автоматжуулсан нийцлийн судлаач (AAR) систем нь туршлагатай хүний санал болгосон аргаас дунджаар зургаан цагийн дотор илүү өндөр гүйцэтгэл үзүүлж байна. Мөн нэг цагийн ажиллагааны өртөг нь хүний хөдөлмөрийн хөлстэй харьцуулахад хамаагүй хямд байгаа нь энэхүү технологийн практик ач холбогдлыг нэмэгдүүлж байна.

Гэсэн хэдий ч энэхүү аргачлал нь хэмжүүрүүдийн үнэн зөв байдал болон ашиглагдаж буй мэдээллийн сангийн хүртээмжээс шууд хамааралтай хэвээр байна. Судлаачид эдгээр хэмжүүрийг тогтвортой байлгах, өргөжүүлэх нь цаашдын гол сорилт хэвээр байгааг онцолжээ.

Дэлгэрэнгүйг эх сурвалжаас харах

↓Эх сурвалжийг нээх ↓

Training AI models with other AI models has become a very popular goal for neolabs — and now, a researcher in Anthropic’s fellows program has given us an early look at what it might look like in practice.

On Friday, Anthropic published a new paper titled “Automated Researchers Can Reliably Mitigate Alignment Failures,” detailing how AI systems could reliably improve a model’s performance on a set of alignment benchmarks. When given 10 benchmarks for specific misaligned behaviors, the automated systems were able to improve performance on every single one without degrading overall performance.

Led by Anthropic Fellow Chen Yueh-Han, the system replicates much of the traditional approach to research. Each automated system searches the available literature, proposes a method, and trains the model using that method for 30 minutes, gradually increasing the benchmark over several iterations. Effective methods are preserved while ineffective ones are discarded, allowing the system to operate quickly and at a great scale.

“Overall, these results provide early evidence that automated alignment post-training could become practical in the near term,” the paper reads.

The paper is a step toward recursive self-improvement, which many see as the next significant step in AI progress. If models can improve their own alignment training, it’s plausible they could improve training practices more broadly — at which point, human AI researchers might soon become obsolete.

The paper isn’t shy about addressing this idea, explicitly comparing the Automated Alignment Researcher (AAR) to its human equivalent. “The best AAR method beats what experienced humans propose, on average within six hours,” the paper reads. “Human guided research directions do not lead to stronger performance.”

There’s even a cost comparison, in case anyone wasn’t convinced. “An AAR costs roughly $4 per hour in API inference against the $150 per hour we pay our human researchers.”

In fairness, the paper also points out a few limitations to this approach. The automated system only works insofar as the benchmarks reflect the actual alignment goals, and even then there’s significant work to be done in establishing and maintaining those benchmarks — not to mention maintaining and expanding on the literature the automated researchers are draw from.

When you purchase through links in our articles, we may earn a small commission. This doesn’t affect our editorial independence.

Та юу гэж бодож байна?

Сэтгэгдлээ оруулна уу!
Please enter your name here

MFC.mn сайтад сэтгэгдэл оруулахад анхаарах зүйлс

Холбоотой

spot_img

Шинэ

spot_img