SuperCLUE
SuperCLUE是一个专注于中文大模型综合测评的权威平台,其产品定位是“中文大模型综合性测评基准”。它为模型研发与应用提供科学、独立、前沿的评测标准,以及客观、公正的参考依据。
www.superclueai.com/homepage - 2026-07-06 - 收藏Artificial Analysis AI基准测试平台
Artificial Analysis平台是一家领先的独立AI基准测试和分析平台,上面分析的模型不仅包括LLM语言模型,还有视觉生成模型如文生图、文生视频、语音转文本、文本到语音等等。Artificial Analysis平台上面提供了各个模型的性能以及成本对比,可以帮助大家来选择最适合的AI大模型
artificialanalysis.ai - 2026-07-06 - 收藏CLiB中文大模型能力评测榜单
目前已囊括195个大模型,覆盖chatgpt、gpt-4o、o3-mini、谷歌gemini、Claude3.5、智谱GLM-Zero、文心一言、qwen-max、百川、讯飞星火、商汤senseChat、minimax等商用模型, 以及DeepSeek-R1、deepseek-v3、qwen2.5、llama3.3、phi-4、glm4、书生internLM2.5等开源大模型。 模型来源涉及国内外大厂、大模型创业公司、高校研究机构。 支持多维度能力评测,包括分类能力、信息抽取、阅读理解、数据分析、指令遵从、算术运算、初中数学、符号推理BBH、代词理解CLUEWSC、诗词匹配CCPM、公务员考试、律师资格考试JEC-QA、高考、高中学科、初中学科、小学学科、常识推理、文本蕴含、成语理解、情感分析、演绎推理、C3中文阅读理解、医师考试之规培结业、医师考试之执业助理医师。 不仅提供能力评分排行榜,也提供所有模型的原始输出结果!有兴趣的朋友可以自己打分、自己排行!
github.com/jeinlee1991/chinese-llm-benchmark - 2026-07-06 - 收藏Livebench LLM模型的基准测试平台
LiveBench 的设计初衷是解决传统 LLM 基准测试中存在的局限性,如数据污染和主观性问题。它通过以下方式实现这一目标: 限制数据污染:LiveBench 每月发布新的问题集,并基于最近发布的数据集、arXiv 论文、新闻文章和 IMDb 电影简介设计问题,从而确保测试集的时效性和新颖性,减少数据泄露的可能性。 客观评分:所有问题都设有可验证的、客观的“基本真实答案”,评分过程完全自动化,无需依赖其他 LLM 作为评审员,确保评分的准确性和公正性。
livebench.ai/#/?highunseenbias=true - 2026-07-06 - 收藏superbench 大模型评测榜单
SuperBench是什么 SuperBench 是由清华大学基础模型研究中心联合中关村实验室在 2024 年共同发布的大模型综合能力评测榜单,致力于为大模型领域提供科学、客观的评测标准,促进大模型技术、生态和应用的健康发展。 其官网首页显示 “致力于打造一个公平、公正、公开、系统的评测体系,以推动国内大模型研究与应用的进步”,并提供了 “加入评测” 和 “最新榜单” 等按钮,方便用户参与和查看最新信息。
fm.ai.tsinghua.edu.cn/superbench - 2026-07-06 - 收藏Arena.ai(前身为 LMSYS)
Arena是什么 Arena(前身为 LMSYS)是一个由 UC Berkeley 研究人员创建的社区驱动平台,专注于衡量和推动 AI 在现实世界应用中的前沿发展。该平台汇集了数千万建设者、研究人员和创意专业人士,通过使用前沿模型并提供反馈,共同塑造一个基于现实世界使用情况的公共排行榜(Leaderboard)。Arena 致力于构建基础,帮助每个人理解、塑造并受益于人工智能,其核心任务是了解 AI 在现实世界中的性能表现。
arena.ai - 2026-07-06 - 收藏FlagEval (天秤)大模型评测
FlagEval (天秤)大模型评测体系及开放平台,旨在建立科学、公正、开放的评测基准、方法、工具集,协助研究人员全方位评估基础模型及训练算法的性能,同时探索利用AI方法实现对主观评测的辅助,大幅提升评测的效率和客观性。FlagEval (天秤)创新构建了“能力-任务-指标”三维评测框架,细粒度刻画基础模型的认知能力边界,可视化呈现评测结果。 目前已推出语言大模型评测、多语言文图大模型评测及文图生成评测等工具,并对广泛的语言基础模型、跨模态基础模型实现了评测。后续将全面覆盖基础模型、预训练算法、微调/压缩算法等三大评测对象,包括自然语言处理(NLP)、计算机视觉(CV)、音频(Audio)及多模态(Multimodal)等四大评测场景和丰富的下游任务。 FlagEval 是智源FlagOpen大模型开源技术体系的重要组成部分。FlagOpen 旨在打造全面支撑大模型技术发展的开源算法体系和一站式基础软件平台,支持协同创新和开放竞争,共建共享大模型时代的“Linux”开源开放生态。
flageval.baai.ac.cn - 2026-07-06 - 收藏OpenCompass司南
OpenCompass(司南)是由上海人工智能实验室发布的开源大模型评测体系,目前已成为业界权威的大模型评估平台,涵盖学科、语言、知识、理解、推理等评测维度,可全面评估大模型的综合能力。
rank.opencompass.org.cn/leaderboard/llm - 2026-07-06 - 收藏LYi 林哥的大模型野榜
这两年各种号称能超越 OpenAI 的大模型层出不穷。为找出最好用的大模型,作者搭建了一个大模型竞技场的网站,并免费开放,希望借助大家的力量做出更适合中国的第三方大模型产品排行榜。目前网站已开始运行,前期模型可能排名不太稳定 “大模型竞技场”的灵感源于LMSYS提出来的Chatbot Arena,聊天机器人竞技场。 测试原理是引入了 ELO 机制,让模型与模型对抗。具体为让两个大模型同时回答用户的一个问题,再由用户选择哪个模型回答得更好。用户出题、用户打分,题目灵活多变,评判标准更接近人的真实感受。 随后还介绍了大模型竞技场中的自动化决定和防作弊功能。通过小AI统计模型在不同维度下的表现,并减少简单重复性问题的影响。同时采用连坐方式防止模型泄露关键信息,保证竞技场的公平性。用户可通过网站进行大模型对抗赛和查看排名信息。 网址:https://lyihub.com/ 介绍视频:https://www.bilibili.com/video/BV1RS421972P/
lyihub.com - 2026-07-06 - 收藏
推荐资讯
推荐站点
造点
核心功能与模型 “造点”平台的最大亮点是整合了业界顶尖的AI模型,实现了“强强联合”: 1. AI生视频:率先接入 通义万相 Wan2.5 全球首发/国内首个: 成为国内首个支持音画同步生成的平台。它可以在生成视频画面的同时,自动匹配人声、音效和背景音乐。 高质量输出: 支持生成长达10秒、1080P高清、24帧/秒的视频,画质可满足专业需求。 强指令遵循: 能够理解并执行复杂的指令,如运镜、视角切换等连续变化。 声音驱动: 用户可以在提示词中用引号(“”)来描述声音,实现声音驱动画面生成。 2. AI生图:集成 Midjourney V7与夸克图片1.0 顶级美学: 接入了Midjourney V7模型。 本土化优化与易用性: 无需魔法,中文友好: 国内用户可以直接使用Midjourney V7模型,无需海外网络环境。 UI简化: 将MJ复杂的参数(如风格化、怪异化)做成了直观的滑块控制,方便调节。 辅助功能: 提供“智能润色”和“特征词库”等功能,帮助新手快速上手。 特色能力: 结合夸克自研技术,夸克图片1.0模型在亚洲人像、中文文字生成、国风元素等方面表现出色,适合电商、设计等场景。 产品体验与工作流 一站式创作流: 用户可以在平台内使用Midjourney V7生成高质量图片后,一键调用通义万相Wan2.5将图片转化为动态视频,整个创作流程非常顺畅。 双端体验: PC网页端: 提供功能最全面的专业创作体验,面向专业创作者。 夸克APP移动端: 提供轻量化的创作体验,以对话式交互为主,满足普通用户的趣味玩法和日常修图需求,如“一句话P图”、换发型、换背景、风格转换等。 价格与优惠活动 会员定价: 标准会员: 48元/月,可生成约400张MJ图片。相比Midjourney官方订阅(约70元/月生成200张),价格近乎“腰斩”。 高级会员: 188元/月,可生成约1800张MJ图片。 还有免费套餐,登录可获取每日积分。 限时免费活动: 活动时间: 即日起至9月30日。 活动内容: 所有用户均可享受7天免费体验通义万相Wan2.5的视频生成功能。 综上所述,“造点”是夸克在AIGC领域推出的一个旗舰级产品,它通过集成中外最顶尖的AI模型(通义万相2.5 + Midjourney V7),并辅以出色的本土化优化和极具竞争力的价格,为从专业创作者到普通用户的广泛人群提供了一个强大且易用的一站式AI内容创作平台。
create.qianwen.com百小应
百川智能发布最新一代基座大模型Baichuan 4,并推出成立之后的首款AI助手“百小应”。Baichuan 4相较Baichuan 3 在各项能力上均有极大提升,其中通用能力提升超过10%,数学和代码能力分别提升14%和9%,在国内权威大模型评测机构SuperCLUE的评测中,模型能力国内第一。此外,Baichuan 4还具备行业领先的多模态能力,在各大评测基准上表现优异,领先Gemini Pro、Claude3-sonnet等多模态模型。在Baichuan 4强大能力的基础上,百川智能将搜索技术与大模型深度融合,推出懂搜索、会提问的AI助手“百小应”。
yi.baichuan-ai.com腾讯元宝
腾讯元宝是基于腾讯混元大模型的AI助手应用,集成AI搜索、AI总结、AI写作、AI绘画等能力,同时支持创意绘画生图,帮助用户在工作、学习和生活中提高效率。
yuanbao.tencent.com