19 Mart'ta BT evi, büyük modellerin halüsinasyon durumunu anlamak ve büyük modellerin derinlemesine ve pratik uygulamasını teşvik etmek için Caict'in resmi Wechat kamu hesabından öğrendi, CAICT Yapay Zeka Enstitüsü, önceki AI güvenlik ölçüt değerlendirme çalışmasına dayanan büyük bir model halüsinasyon testi başlattı.
Büyük model halüsinasyon (AI halüsinasyonu), model içerik veya cevap soruları oluşturduğunda makul görünen içeriği ifade eder, ancak aslında kullanıcı girişi (Fidelity Halüsinasyon) veya gerçeklerle tutarsız (gerçek halüsinasyon) tutarsızdır. Tıp ve finans gibi kilit alanlarda büyük modellerin yaygın olarak uygulanmasıyla, büyük model halüsinasyonların getirdiği potansiyel uygulama riskleri artmaktadır ve endüstriden yaygın dikkat çekmektedir.

Bu halüsinasyon testi turu, test nesnesi olarak büyük dil modellerini kullanacak ve iki tür halüsinasyonu kapsayacaktır: gerçek halüsinasyonlar ve sadık halüsinasyonlar. Spesifik değerlendirme sistemi aşağıdaki gibidir:
Test verileri 7'den fazla 000 Çin test örnekleri içerir. Test biçimi iki tür soru içerir: sadık halüsinasyon tespitine karşılık gelen bilgi çıkarma ve bilgi akıl yürütmesi ve gerçek halüsinasyon tespitine karşılık gelen gerçek ayrımcılığı soruları. Genel olarak, beş test boyutu içerir: beşeri bilimler, sosyal bilimler, doğa bilimleri, uygulamalı bilimler ve resmi bilimler.
Çin Bilgi ve İletişim Teknolojisi Akademisi, ilgili şirketleri model değerlendirmesine katılmaya ve büyük modellerin güvenli uygulamasını ortaklaşa teşvik etmeye davet ediyor.
