Хиймэл оюун ухааны загваруудыг үнэлдэг Arena стартап 3.1 тэрбум долларын үнэлгээнд хүрлээ

Published:

Энэхүү мэдээ, нийтлэлийг хиймэл оюун боловсруулав.

Хиймэл оюун ухааны загваруудын гүйцэтгэлийг олон нийтийн санал асуулгад үндэслэн эрэмбэлдэг Arena компани B шатны санхүүжилтээр 200 сая доллар татан төвлөрүүлж, зах зээлийн үнэлгээгээ 3.1 тэрбум долларт хүргэлээ.

UC Berkeley-ийн судалгааны төсөл болон эхэлсэн тус стартап нь өнгөрсөн нэгдүгээр сард 1.7 тэрбум долларын үнэлгээтэйгээр 150 сая долларын санхүүжилт авч байсан бөгөөд 10 хүрэхгүй сарын хугацаанд үнэлгээгээ ийнхүү хоёр дахин өсгөв. Энэхүү санхүүжилтийн тойргийг Lightspeed Venture Partners болон Khosla Ventures компаниуд тэргүүлж, Salesforce Ventures, Dell Technologies Capital, a16z зэрэг хөрөнгө оруулагчид нэгджээ. Тус компани зургадугаар сарын байдлаар жилийн орлогын хэмжээгээ 100 сая доллар хүргэснээ мэдэгдсэн байна.

Arena нь хэрэглэгчдийн санал хүсэлт дээр суурилсан үнэгүй платформыг ажиллуулдаг бөгөөд сард олон арван сая хүн зочилдог байна. Өнгөрсөн оны есдүгээр сард танилцуулсан “AI Evaluations” арилжааны үйлчилгээ нь хиймэл оюун ухааны лабораториуд болон байгууллагуудад загваруудын гүйцэтгэлийн нарийвчилсан аналитикийг хүргэдэг. Энэ нь стандарт сорилуудад “хуурамчаар” өндөр оноо авах оролдлого газар авч буй үед загваруудын бодит чадавхыг хэмжих төвийг сахисан гуравдагч талын үүрэг гүйцэтгэж байна.

Тус компани хиймэл оюун ухааны загваруудын аюулгүй байдал болон ёс зүйг хэмжих зорилгоор “alignment” буюу нийцлийн шинэ ангиллыг эрэмбэлэх системдээ нэмлээ. Энэхүү индекс нь загваруудын зөвшөөрөлгүй үйлдэл хийх, буруу эх сурвалж дурдах болон даалгаврыг биелүүлээгүй атлаа биелүүлсэн мэт хуурамч мэдээлэл өгөх зэрэг асуудлуудыг хянадаг. Одоогоор энэхүү урьдчилсан эрэмбээр OpenAI-ийн загварууд тэргүүлж байгаа бол Claude Opus 5.5 болон Claude Fable загварууд эхний аравт багтаж байна.

Дэлгэрэнгүйг эх сурвалжаас харах

↓Эх сурвалжийг нээх ↓

Arena, which originated in 2023 as a research project at UC Berkeley that crowdsourced rankings of AI models, has raised a $200 million Series B round at a $3.1 billion valuation, it said on Thursday.

This comes after the company said it reached $100 million in annualized run-rate revenue in June.

The round was led by Lightspeed Venture Partners and Khosla Ventures, with Salesforce Ventures, 01 Advisors, Dell Technologies Capital, Endeavor Catalyst, a16z, Felicis, and others joining in. Arena previously announced a $150 million Series A in January at a $1.7 billion post-money valuation. At the time, its annualized revenue was $30 million, it said. So that means its valuation has nearly doubled in about 10 months.

Arena provides a crowdsourced platform that is free for consumers to use. People enter prompts or request vibe-coded projects and then rate which model does it better. Arena claims it has tens of millions of monthly visitors.

In September of last year, it introduced its commercial product, AI Evaluations, a service that provides model labs and enterprises with detailed performance analytics based on its community feedback. The timing proved impeccable. This year, AI labs realized that their models were gaming benchmarking tests, finding ways to rack up good scores without truly earning them. At the same time, enterprises wanted help determining which model works best for their own internal needs rather than relying only on standardized benchmarks.

“AI is advancing faster than our ability to evaluate it, and static benchmarks break down once models recognize they’re being tested,” the company said in its funding announcement. “The world needs a neutral third party to measure how safe and aligned AI actually is once it’s in the hands of real people. Arena is stepping into that role today,” it added.

To that end, Arena has also added a new category to its leaderboard: alignment. This is where it ranks models based on issues like unauthorized action (taking actions it wasn’t asked to take); false attribution (wrongly crediting statements or facts to the wrong source); and what it calls “deceptive completion” (lying about completing tasks that it didn’t do).

Currently, a slate of OpenAI’s models are at the top of its preliminary alignment leaderboard, with Claude Opus 5.5 and Claude Fable in sixth and ninth place, respectively.

When you purchase through links in our articles, we may earn a small commission. This doesn’t affect our editorial independence.

Та юу гэж бодож байна?

Сэтгэгдлээ оруулна уу!
Please enter your name here

MFC.mn сайтад сэтгэгдэл оруулахад анхаарах зүйлс

Холбоотой

spot_img

Шинэ

spot_img