FlagEval (天秤)大模型评测

3周前发布 721 0 0

FlagEval (天秤)大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准、方法、工具集,协助研究人员全方位评估基础模型及训练算法的性能,同时探索利用AI方法实现对主观评测的辅助,大幅提升评测的效率和客观性。

语言:
zh
收录时间:
2026-08-31
FlagEval (天秤)大模型评测FlagEval (天秤)大模型评测

FlagEval (天秤)大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准、方法、工具集,协助研究人员全方位评估基础模型及训练算法的性能,同时探索利用AI方法实现对主观评测的辅助,大幅提升评测的效率和客观性。

数据统计

相关导航

MuleRun

MuleRun

MuleRun(骡子快跑)是一个创新的AI智能体平台,被称为全球首个AI Agent交易市场。MuleRun支持15个主流大模型的统一接入,通过模块化和标准化的方式集成各类AI能力,实现AI工具的“即插即用”。MuleRun提供多样化的AI Agent,这些Agent能够执行多领域任务,包括但不限于内容创作、游戏辅助、市场调查以及自动化任务处理等,用户可以方便地选择并使用这些AI工具,无需复杂设置,只需找到所需工具并运行即可。MuleRun也被称为Agent界的“淘宝”,其开放平台吸引了全球AI创作者。
Poe

Poe

Poe是一款AI大模型集合工具,它接入了市面上大多数的AI大模型,在Poe上可与ChatGPT、GPT-4o、Claude 3.5 Sonnet、FLUX1.1等最优秀的人工智能模型以及其他数百万个模型交谈。 同时还能与StableDiffusion、Runway、Pika包括图像/视频/音频等生成模型进行沟通,一个平台搞定所有的大模型。 Poe 支持同时与多个机器人进行对话,用户可以通过机器人比较不同的查询答案,增强信息的精确性和相关性。 Poe 大多数的模型是免费的。一些更为先进的模型则需要付费使用。需要注意,国内无法直接访问poe
WeSight

WeSight

WeSight是一款开源的桌面端AI Agent统一管理工作台,可以帮助用户单界面集中管控各类代码智能体。WeSight搭载可视化控制面板,支持一键接入Claude Code、Codex、OpenClaw、Hermes Agent、OpenCode、Qwen Code、DeepSeek-TUI等主流的代码Agent,把它们统一到一个可视化工作台,集成文件管理、对话交互、自定义技能、自动化工作流等功能。WeSight可以实时监测各智能体运行速率、资源占用与任务进度,开发者能够批量下发编码、调试、项目搭建任务,自由切换不同大模型算力,适配个人编程、小型项目开发、自动化脚本落地等场景。