跳到正文
原文
英国 AI Security Institute:Blog(网页)· 英国 AI Security Institute:Blog(网页)·· 2024-12-03精选AI 评分61

英国 AI Safety Institute 提出 Long-Form Task 方法评估 LLM 科学助手能力

AI 导读

英国 AI Safety Institute(AISI)提出 Long-Form Task(LFT)评估方法,作为人类提升研究(HUS)的可自动化替代,用于测量 LLM 在科学场景中提供分步指导的能力。

推荐理由

原文给出 LFT 评估方法的设计细节与案例结果,读者可了解自动评估科学助手能力如何平衡可解释性与可部署性。

来源:英国 AI Security Institute:Blog(网页) · aisi.gov.uk