正在做一份本地模型的实用能力排行榜,测试集是从各种公开 benchmark中挑选微调,覆盖任务拆解、代码开发、长链路执行、上下文、指令遵循、记忆抽取、逻辑与常识 7 个维度
目前针对本地模型的评测很少,不知道有人感兴趣不,关注人多的话,我尽快测完放出来
正在做一份本地模型的实用能力排行榜,测试集是从各种公开 benchmark中挑选微调,覆盖任务拆解、代码开发、长链路执行、上下文、指令遵循、记忆抽取、逻辑与常识 7 个维度
目前针对本地模型的评测很少,不知道有人感兴趣不,关注人多的话,我尽快测完放出来