初创企业Acrab近日推出首款面向边缘计算的AI终端系统级芯片GΞLIX 1,该产品采用5纳米先进制程工艺,首次实现1000亿参数规模大语言模型在终端设备的本地化运行。这一突破标志着端侧AI计算能力进入全新阶段,为智能终端设备处理复杂AI任务提供了硬件基础。
芯片架构设计方面,GΞLIX 1采用异构计算方案,集成20核Arm架构CPU核心、3TFLOPS算力的GPU单元以及独立NPU加速器,配合专用音视频处理引擎,整体AI运算能力达到650万亿次每秒(TOPS)。对比行业主流产品,其算力约为高通骁龙X Elite平台NPU的14倍,英特尔酷睿Ultra系列NPU的16倍,在终端芯片领域形成显著优势。
针对大模型推理的特殊需求,研发团队重构了存储子系统架构。芯片配备8MB一级缓存,二级缓存共享带宽达768GB/s,外接256位宽LPDDR5X内存通道,数据传输速率突破8533MT/s。这种设计有效解决了权重参数读取和KV缓存存取对内存带宽的严苛要求,为百亿参数模型的端侧部署扫清技术障碍。
在核心的预填充处理环节,工程团队通过硬件加速与算法优化实现突破性进展。预填充作为大模型响应的首个计算阶段,其处理速度直接决定长文本输入场景下的响应延迟。Acrab专门设计的矢量计算单元可并行处理Transformer注意力机制运算,配合优化的数据流路径,使该环节的处理效率大幅提升。
实测数据显示,在40K KV缓存容量和10K Token输入长度的测试条件下,运行Gemma 26B大模型时,GΞLIX 1达到每秒1416.8个Token的处理速度。这一性能表现是苹果M4 Pro芯片在Mac Mini设备上实测结果的7.5倍,特别是在长文本生成场景下,首Token生成延迟显著降低。
为构建完整技术生态,Acrab同步推出配套软件栈和智能体开发框架,覆盖从驱动层到应用层的全链条开发工具。现场展示的Agent Box终端设备作为技术验证平台,集成了芯片全部功能特性,为开发者提供从算法评估到原型落地的完整解决方案。该参考设计已开放开发者申请,预计将加速AI终端产品的创新周期。