

Reka 是一家由前 Google DeepMind 和 Meta 研究人员创立的多模态 AI 公司,提供从 7B Edge 到 67B Core 的系列模型,能够原生处理文本、图像、视频和音频输入,专为企业级应用打造。
Reka 是一家成立于 2022 年的 AI 公司,由来自 Google DeepMind、Meta 和 Baidu 的研究人员创立,由首席执行官 Dani Yogatama 和首席科学家 Yi Tay 领导,后者曾领导 Google 的 PaLM 和 UL2 开发。该公司构建了一系列从零开始训练的多模态语言模型,这意味着其产品线中的每个模型都将文本、图像、视频和音频作为原生的一等输入来处理,而不是通过事后适配器。Reka 的核心主张是为需要部署灵活性的企业带来前沿的多模态推理能力:支持云端、本地、VPC 隔离或完全物理隔离(air-gapped)部署。
目前的产品线涵盖四个模型层级。Reka Core (67B) 是旗舰模型,能够处理跨越所有四种输入模态的复杂推理任务,并具备 128,000 个 Token 的上下文窗口。Reka Flash (21B) 是性价比层级:Flash 3 变体于 2025 年 3 月在 Apache 2.0 协议下开源,可用于自托管部署。Reka Edge (7B) 针对受限硬件上的实时推理,而 Reka Spark (1B) 则专为设备端嵌入而设计。所有模型均可通过带有 Python 和 JavaScript SDK 的 RESTful API 进行访问,该公司的 Reka Vision 平台为包括 Shutterstock 和 Turing Video 在内的企业客户处理大规模视频和图像搜索。
Reka 概览(2026 年 4 月)
Reka 的模型系列目前包含四个生产级模型。Reka Core 是 67B 的旗舰产品,在 32 种语言的 5 万亿个去重 Token 上从零开始训练,具有 128K 的上下文窗口。Reka Flash 21B 是首个获得社区广泛关注的模型,尽管其训练团队仅有约 20 名研究人员,但它在 MMLU 和 GPQA 基准测试中与 Gemini Pro 表现相当。2025 年 3 月在 Apache 2.0 协议下开源的 Reka Flash 3,在参数减少 34% 的情况下与 QwQ-32B 展开竞争,并支持 32K 上下文。随后在 2025 年 7 月推出了经过强化学习改进的 Flash 3.1。Reka Edge (7B) 是同等参数量下同类中最快的视觉语言模型,在多模态任务上超越了 Gemma 7B 和 Mistral 7B。Reka Spark (1B) 则针对子设备(sub-device)嵌入式部署。
在产品方面,Reka 提供三种访问途径:用于多模态输入 LLM 风格交互的 Chat API、用于具有并行思考模式的智能体多步推理任务的 Research API (reka-flash-research),以及用于大规模视频和图像搜索的 Reka Vision。部署模式包括 API、托管云、本地部署(on-prem)、VPC 和物理隔离,这使得 Reka 的部署灵活性更接近企业数据库供应商,而不是 OpenAI 或 Google。
Reka 的真正优势所在
Reka 的真正优势在于原生视频理解。当 Core 技术报告于 2024 年 4 月发布时,Reka Core 在 Perception Test 视频基准测试中得分为 59.3%,领先于 Gemini Ultra 的 58.7%。GPT-4o 完全无法原生处理连续的视频片段,只能处理提取的帧。对于需要查询大型视频档案、索引监控录像或在媒体库上运行推理的企业来说,Reka Core 和 Reka Vision 是专门为此构建的,而通用前沿模型则并非如此。
Reka Flash 3 的开源发布是另一张王牌。对于希望拥有一个功能强大的 21B 推理模型,并且可以在本地运行、自托管、微调和修改而不受许可限制的开发人员来说,现在有了一个 Apache 2.0 选项,其基准测试结果可与同等量级的专有模型相媲美。其 65.0 的 MMLU-Pro 得分和强大的 AIME-2024 数学推理能力,使其在编码、指令遵循和函数调用任务中具有极高的可信度。
多语言能力也是一个真正的差异化优势。凭借对 32 种语言的支持以及在翻译基准测试中的强劲表现(Flash 3 在 COMET WMT'23 上得分为 83.2),Reka 在需要同时兼顾视觉任务以及欧洲和亚洲语言覆盖的部署中极具竞争力。
"我们很高兴能与 Reka 合作,通过 Snowflake Cortex 将 Reka Core 令人印象深刻的行业领先性能带给客户。" - Baris Gultekin,Snowflake AI 负责人,Reka 新闻稿,2024 年 4 月 15 日
"Reka 动态的多模态和多语言模型使企业能够从其数据中释放更多价值。" - Greg Pavlik,Oracle AI 与数据管理高级副总裁,Reka 新闻稿,2024 年 4 月 15 日
Reka 的局限性:用户经常遇到的痛点
Playground 的视频限制是从业者讨论中首先浮现的挫败感。chat.reka.ai 界面将视频上传限制为 30MB 和一分钟。对于使用真实素材进行测试的媒体专业人士或企业团队来说,这是一堵硬墙,迫使他们在进行任何有意义的评估之前必须切换到 API。
企业定制(微调、本地部署、VPC 隔离)不是自助式的。除了标准 API Token 成本之外,没有任何透明的定价。需要定制部署的团队必须联系销售人员,观看演示,并协商合同,然后才能评估 Reka 是否真正适合他们的工作负载,与 Google Vertex AI 或 AWS Bedrock 相比,这造成了长达数月的摩擦。
与 OpenAI 和 Google 相比,生态系统深度较浅。社区构建的教程、第三方集成、LangChain 插件以及引用 Reka 的公开基准测试都很稀少。为全新项目选择模型的开发人员会发现,GPT-4o 或 Gemini 的预构建工具远多于任何 Reka 模型。Reka Flash 3 已经开始为开源社区改变这一现状,但专有层级的模型在官方渠道之外仍然缺乏足够的文档支持。
知识截止日期是另一个差距。Reka Core 的训练数据知识截止日期是 2023 年 11 月,这在 2024 年 4 月发布时就已经过时,而到了 2026 年则显得更加陈旧。OpenAI 和 Google 都在更积极地刷新模型的知识截止日期。
最后,Research API 的并行思考模式带来了高昂的成本乘数:“低”并行思考为每千次请求 $35,而标准模式为 $25,“高”并行思考则为每千次请求 $60。随意探索智能体工作流的团队可能会产生意想不到的高额账单。
Reka vs. GPT-4o vs. Gemini 1.5 Pro
架构与视频处理。 GPT-4o 是一个全模态 Transformer,估计参数量约为 200B。它原生处理文本、图像和音频,但 GPT-4o 中的视频处理是对提取的帧进行操作,而不是连续的视频流。Reka Core 将完整的视频片段作为连续模态进行处理,这对于监控、媒体或科学视频分析任务来说是一个有意义的架构差异。Reka Core 的上下文窗口为 128K Token,与 GPT-4o 相当。发布时的定价具有可比性(输入/输出每 1M Token $10/$25),但 Reka 此后已将 Core 定价降至每 1M Token $2.00/$6.00,低于 GPT-4o 的 $2.50/$10.00。OpenAI 不提供本地部署;而 Reka 提供。
上下文窗口与部署。 Gemini 1.5 Pro 拥有对长文档企业工作最重要的架构优势:100 万 Token 的上下文窗口,大约是 Reka Core 128K 的 8 倍。Gemini 1.5 Pro 还接受原生视频输入,片段长达一小时,而 Reka 的 Playground 上限为一分钟,API 的上限为几分钟。在日常使用的成本方面,Gemini 进一步领先:Gemini 1.5 Flash 每 1M Token $0.075/$0.30 的价格远低于 Reka Flash 的 $0.80/$2.00。然而,Gemini 仅通过 Google Cloud (Vertex AI) 提供,并且没有本地部署路径。Reka 支持 Google 无法匹敌的物理隔离企业部署。在 2024 年 4 月的视频感知基准测试中,Reka Core 略微领先于 Gemini Ultra(59.3% 对 58.7%),尽管 Gemini 后续的模型仍在不断进步。
开放权重。 GPT-4o 和 Gemini 1.5 Pro 都没有公开释放权重。Reka Flash 3(21B,Apache 2.0)可从 Hugging Face 下载,并且可以自托管、微调和修改。对于有数据主权要求的组织或无法通过第三方 API 路由敏感数据的团队来说,这是一个具体的差异化优势。
付费层级值得吗?
Reka 的按 Token 定价是诚实的现收现付模式,无需预先承诺。新账户可获得 $20 的免费额度,足以进行有意义的测试。对于标准文本工作负载,Reka Flash 每 1M Token $0.80/$2.00 的价格与中端模型相比具有竞争力,尽管 Gemini 1.5 Flash 的价格要低得多。Reka Core 每 1M Token $2.00/$6.00 的价格低于 Claude 3 Opus,与 GPT-4o 相当,但缺乏生态系统深度。
在三种情况下,经济性有利于 Reka:(1) 视频推理,Reka Core 每视频分钟 $0.08 的定价适合生产规模使用;(2) 本地部署,Reka Flash 3 作为开放权重的 Apache 2.0 模型,完全消除了自托管团队的按 Token API 成本;(3) 亚洲或欧洲语言的多语言企业工作负载,Reka 的 32 种语言训练在此时发挥了作用。
Research API 的定价结构(根据思考模式,每千次请求 $25-60)最好被理解为智能体管道成本,而不是聊天 API 成本。对于单次查询来说,它很昂贵;但对于取代人类研究分析师的工作流来说,这笔账就划算了。定制部署的企业定价需要联系销售,并且未公开。
最佳用例(以及何时应避开)
在以下情况使用 Reka: 您的应用程序依赖于大规模的原生视频理解,您需要具有本地或物理隔离部署的多模态推理,您想要一个可以自托管且没有供应商锁定的 Apache 2.0 21B 推理模型,或者您正在构建需要强大的亚洲和欧洲语言覆盖以及视觉能力的多语言应用程序。媒体公司、企业安全团队、处理成像和患者记录的医疗保健组织,以及拥有大量视频传感器数据的采矿或制造公司,都是 Reka 的天然客户。
在以下情况避开 Reka: 您需要 1M+ Token 的上下文窗口来进行长文档工作(请使用 Gemini 1.5 Pro)。您需要最广泛的第三方集成和教程生态系统(请使用 GPT-4o)。您是希望拥有日常任务对话助手的个人用户(ChatGPT Plus 更适合)。您的团队缺乏集成原始 API 的工程资源,或者您的预算要求留在垂直集成的平台中(Google AI Studio 或 OpenAI 的 ChatGPT Enterprise 是更简单的起点)。对成本敏感的纯文本工作负载可能会发现 Gemini Flash 或基于 Llama 的替代方案更便宜。
开始使用 Reka
Reka 的 API 可在 docs.reka.ai 获取,并提供 Python 和 JavaScript SDK。新账户可获得 $20 的额度,足以在投入资金之前测试 Core、Flash 和 Spark 的文本和图像输入。位于 chat.reka.ai 的 Reka Playground 提供基于浏览器的访问以测试多模态输入(请注意 Playground 中 30MB/1 分钟的视频限制)。对于开放权重路径,Reka Flash 3 和 Flash 3.1 可在 Hugging Face 上以 Apache 2.0 协议获取。模型权重下载大小为 39GB (fp16) 或 4-bit 量化下的 11GB,使得 Flash 3 可以在单张 A100 GPU 上运行。本地或 VPC 中的企业部署需要通过 reka.ai 联系 Reka 的销售团队。
用户评价
暂无评价,快来分享你的第一条体验吧!
登录 后即可撰写评价。
相关文章
与 Reka 相关的指南和文章。

Google Vision AI Explained (2026): Pricing Per 1,000 Units, Free Tier, and Alternatives

Grok 4.3 API for Agents (May 2026): Pricing, Benchmarks, Migration

Nous Hermes 4: The Self-Hosted Open-Weight Agent Brain (2026)

OpenAI GPT-Realtime-2 (May 2026): Pricing, Latency & 30-Min Voice Agent
