
FlagEval
⭐ 3.6🇨🇳 中国FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台,为研究人员提供全面评估基础模型及训练算法性能的工具和方法。FlagEval采用“能力-任务-指标”三维评测框架,从多个维度对大模型
#models
分类
🧪 模型与开源
地区
🇨🇳 中国
定价模式
免费
国内直连
可直连
免费额度
有
工具介绍
FlagEval(天秤)是北京智源人工智能研究院(BAAI)推出的科学、公正、开放的大模型评测体系及开放平台,为研究人员提供全面评估基础模型及训练算法性能的工具和方法。FlagEval采用“能力-任务-指标”三维评测框架,从多个维度对大模型的认知能力进行评估,涵盖对话、问答、情感分析等多种应用场景,提供超过22个数据集和8万道评测题目。
站内评测
该工具暂无深度评测,敬请期待。
相似工具
模型与开源爱派AiPy
★ 3.6
AiPy(爱派)是免费开源的AI智能体工厂,本地版Manus,基于大语言模型(LLM)和Python编程能力,支持本地部署,确保数据隐私安全。AiPy通过“Python-Use”范式,为AI“装上双手”,能分析本地数据、操作本地应用、执行复
AnythingLLM
★ 3.6
开源的全栈 AI 客户端,支持本地部署和API集成
百小医
★ 3.6
百小医是百川智能推出的AI家庭医生平台,由"百小应"升级更名而来,采用APP+企业微信BOT双端架构。基于自研M4医疗大模型,HealthBench评测全球第一,具备问诊、循证、专病、多模态与长期记忆能力。
Chatbox AI
★ 3.6
开源的AI客户端助手,支持多种主流AI模型