TRUEBench是什么
TRUEBench(Trustworthy Real-world Usage Evaluation Benchmark)是三星电子推出的 AI 基准测试工具,用在评估人工智能在实际工作场景中的生产力,解决现有AI基准测试的局限性,如主要以英语为中心、仅限于单轮问答结构等。TRUEBench包含2485个测试集,涵盖10个类别和12种语言,支持跨语言场景。TRUEBench通过人机协作设计和优化评估标准,确保评估的准确性和一致性。TRUEBench的数据样本和排行榜已在Hugging Face平台上发布,用户能比较最多五个模型的性能和效率。

TRUEBench的主要功能
- 全面评估AI生产力:TRUEBench围绕10个类别和46个子类别中常用的企业任务进行评估,涵盖内容生成、数据分析、文本摘要及翻译等。
© 版权声明
文章版权归作者所有,未经允许请勿转载。