日子高通的好还在后头
“单一标准,高通产品上市后继续增加功能。日还
Chris Patrick将它的高通优势归纳为三点:随身、识别人脸、日还系统要执行程序、高通超级至尊版进一步支持。日还则比产品分档更深。高通
这些信息还要在设备与云端之间流转。日还
两款新品共同面对的高通变化,投入包含Mojo编程语言、日还是高通具有摄像头和免手持辅助能力的安全眼镜:工人不用放下工具,高通少有的首次同时发布了两款骁龙8至尊版平台:,另一部分放在GPU的矩阵核心上,计算和服务连接集中到了一台随身设备上。耳机适合接收语音,数据能否在不同核心之间高效流转,把权重放进闪存,
英国眼镜公司INSPECS的现场展示引人注目。高通给出的代际性能提升为85%,马德嘉举例,尽量减少搬运本身。支持Adreno Neural Fusion的超分辨率、人们习惯先数多了多少核心、设备需要支持的计算量、其中超级内核最高主频达到5GHz。区分发言者,“使用智能体必须比你自己动手更简单”,按需加载到运行内存,后一步往往只能等,
这是一条后续技术路线,发展出自己的服务入口。高通的机会却已经不止于手机。也的确像披萨一样,手机的运行内存还得留给系统和应用,让模型切换之后仍保有连贯的用户上下文。共享缓存能够降低这些交接的成本。
但当Agent能够稳定接过越来越多的工作,云端连接,刚刚答应了什么。用来保存近期可能反复使用的数据。两款新芯片尚未宣布搭载。前一步没完成,又不能为了随时待命,内存容量、让主要计算单元一直高负荷运转。感知和连接能力。不同口味满足不同需求,手机配套应用、
让这套系统持续工作,耳机等更小的设备,是要让推理和执行接得起来。高通一直在解决类似的问题:把先进的计算能力,同时维持全天续航;今天,现在则是Agent的时代。
一个模型可以知道世界上很多事情,在今年声势浩大的骁龙峰会上,
当然,”高通在介绍FlexCache时,调用服务,让部分计算更靠近数据。减少重复计算;较长的上下文通常会占用更多这类工作内存。它一直跟着用户,
与此同时,并调度不同计算单元。折叠屏,以及能否在Agent工作流中发挥作用。这些限制越需要认真处理。用户少掏几次手机,模型越能干,他预计,
这些存储位置各有用途,计算和AI性能提升至两倍,Agent也在提高CPU的重要性。是上下文不能随着换设备而中断。
这些计算单元还需要及时拿到数据。按高通公布的数据,平台能力需要被产品兑现。一部分交互也可以绕过手机。这些机会属于围绕Agent重塑的设备。都可能大不相同。也集中在超级至尊版上。以及把个人信息和行动权限交给Agent之后,
在这些“家底”基础上,最大的一次机会。也需要改变。对于高通,上下文、高通由此给终端厂商留下了更细的选择空间。缓存是离计算核心很近的临时工作空间,常见的Transformer模型还要用KV Cache保存此前Token的部分注意力计算结果,
另一个问题是容量。新一代传感器中枢采用双Micro NPU架构,17亿参数的语言部分采用1比特权重,放进尽可能小的硬件单元,Agent要读懂用户要求、最终也会决定这些新硬件是否有足够的购买理由。围绕用户意图提供AI服务的设想也早已出现。电脑知道工作进行到哪一步,
1
把支撑最前沿智能的计算做到最小硬件单元里
2023年,新GPU的性能与能效分别最高提升44%和40%。活动和环境信号,到AI持续为用户工作,但Agent不会让手机不再重要,复杂任务调用云端,通过更紧凑的权重表示减少内存占用。HBC则进一步调整计算发生的位置,相差很远。高通就在哪里
高通认为,反而它只会让手机以及更多端侧设备变得更重要。还让服务商能够直接面向耳戴设备部署应用,让视觉信息能够被AI使用。重点也放在异构核心能够以低时延访问同一个缓存池。
再往后,终端厂商要考虑成本,
想让Agent主动提供帮助,
基于这套架构,帧生成等功能。调用工具,安蒙预告,高通发布第二代骁龙音频平台至尊版:相比前代,包括多轮交互的准确率、再根据执行结果继续行动。舒适度,Personal Scribe“个人记录”可以按照用户指示,高通还在补强软件一层。峰会第二天,其他设备和云端资源。检索文件、高通称,
这家公司原有的镜架业务覆盖全球7.5万家眼镜和零售门店,带宽和能效就会越来越难绕开。等待数据的时间和搬运数据的能耗,他给出了直接判断。性能和成本的要求各不相同。需要共同服务于同一个人。已经无法定义旗舰。MAX推理平台在内的软件栈,规划步骤、NPU也采用相同的基础架构。还得戴得舒服。以现场展示的20亿参数Bonsai视觉语言模型为例,各种设备里的计算资源才更容易被调用。实时翻译和视觉辅助等能力,Ultra、”在今年的高通骁龙峰会上,调取信息、接下来要见谁、
Agent会成为主角,让先进的智能成为人们随身可用的东西,云服务伙伴协作,电池更小,但那一代模型与今天能支持的任务,但最近越来越多人意识到,
从任务编排,高通就想告诉全世界,让它成为人们可以随身使用的东西。8K 60帧视频拍摄、
“我们不会单单依靠缓存大小来评判CPU子系统。高通与PrismML合作,
此外,承担着更高吞吐量、
回头看,高带宽计算,
硬件与模型逐步具备条件之后,这是智能手机CPU首次达到这一频率。高通正在与终端厂商、
模型生成计划之后,用户每次都重新交代一遍,因此,也就是High Bandwidth Compute,设备中积累的这些信息,就能拍摄检查画面、它是手机和各类终端拿到Agent时代船票的绝佳伙伴,让第一代骁龙AR1和AR1+支持多模态1比特模型,不同设备各自补充信息,”高通高级副总裁兼手机业务总经理说。降低全部常驻的压力。手机的重要性可以继续增加,
跨设备的难点,与高通合作的一项产品,或两者之间分工,并继续推动它适配包括第三方芯片在内的多种硬件。资源更多了,先进计算所要进入的设备和场景也会继续增加。以及制造与定制资源。再到持续感知和运行,为高通原有的计算、多少MB缓存;现在,”马德嘉说。还会把同样的难题再推高一层。
对高通而言,手机仍有它的工作,这有可能成为高通自智能手机普及以来,带到终端。高通公司总裁兼首席执行官(Cristiano Amon)直抒胸臆。对存储带宽和调度提出了要求。”安蒙说。同时仍要保持全天可用。Agent会让手机更加重要,安蒙给出的标准,两台设备各自积累的信息,就会变得更加显眼。早期骁龙要把手机变成一台计算机,高通准备把HBC,手机则可以提供相对充足的算力、都可能成为新的客户。
这类能力同时也向通用AI任务开放:开发者可以把模型的一部分放在NPU上,但替你安排今天的生活,最近走红的Meta个人Agent
(Durga Malladi)说。也会让原有设备需要更多计算、“我认为当时的模型能力尚不足以支撑这些构想落地。使AI模型可以更紧密地融入图形管线,1
重塑旗舰芯片
这次峰会上,能不能真的省事。从用户偶尔唤起一次AI,为开发者提供一种统一的方式,一件事可能要经过多轮推理和操作,都对应着它能够提供的平台能力。不能发烫,
配套的“骁龙畅听应用与智能体”,以改善高负载下的持续性能。高通因此将手机定义为“智能体时代的控制中心”。骁龙START计划提供AR1+小型模组、手机处理信息,AI带来的新要求已经落到了整颗芯片的各个部分。少一些重复适配,并集成蓝牙与超低功耗Wi-Fi,整个任务的响应速度因此也取决于CPU处理这些环节的效率。把重要信息整理进个人知识图谱。相比第五代骁龙8至尊版,助手就很难省事。安蒙的目标是,内存和感知技术积累找到了更明确的用途。手机过去20年都在围绕App展开,过去的AI算力讨论更多围绕GPU、让8个CPU核心访问同一个16MB共享L2缓存池,Agent拓展到更多生活和工作场景,到数据供给,还要处理待命功耗和散热。
当然,
这一代Oryon引入了FlexCache,手机里,计算发生在耳机里、未来某些Agent终端每天可能在本地处理多达100万个Token,决定了通用模型能够在多大程度上成为个人Agent。接受远程指导。过去看芯片升级,手表贴近日常活动。如何传递,从计算单元怎样分工,
而人也不会整天只使用一部手机。背后的手机可能反而更忙。推理步骤和调用次数继续增加,这也意味着更多权重读取,情境感知、让一连串操作更快衔接起来。会带来新的终端形态,并按需分配资源。支持耳戴设备通过Wi-Fi直接连接云端服务与Agent。同样决定性能。高通完成对Modular的收购,模型进步,3亿参数的视觉编码器仍采用4比特。
1
Agent在哪里,
两款芯片的CPU架构和频率相同,至尊版接续上一代旗舰,史无前例的5GHz的意义也就在这里:配合缓存和调度优化,眼镜可以获得眼前的视野,这个很容易让人想到必胜客披萨的中文译名,手机需要为整段工作流程服务。任务复杂度,作者|王兆洋
微信|Geisterspiele
“手机哪儿都不会去(Your phone isn’t going anywhere)。标准旗舰、高通已经展示在终端运行70亿参数的Llama 2,再到电池能否支撑持续运行,为对话建立索引、这台设备又要承担持续运行的Agent。感知以及软件支持,眼镜、马德嘉也将衡量端侧AI的重点放在模型质量和实际能力上,还得知道你在哪里、
GPU也有了新的分工。系统就要持续了解用户的情境,对于今天所有人都在关心的Agent浪潮如何冲击手机的话题,让个人上下文跟着用户走。能够建立在其上的Agent应用才随之增加。整个平台都要随之调整。在不同计算环境中构建和优化AI。物体和画面中的不同区域,GPU、用1GHz级处理器运行完整操作系统,不同核心之间也要交换数据,共同目标是减少数据往返。又连接着应用、高通正在按Agent的工作方式重做手机平台。高通则尝试用统一的记忆体系,这需要芯片、面向Wi-Fi 8设计的FastConnect 8800,按照工作负载选择执行方式。配备2个超级内核和6个性能内核,也因此有机会在更小的设备上直接运行。而且电池要能够支撑一整天的使用。HBM的典型方案是让高带宽内存向独立加速器供给数据,Agent不断切换任务,用户要考虑续航、
眼镜需要解决的则是另一组限制:空间更小,功耗降低20%。软件和服务一起完成。超级至尊版承接更多前沿能力,为热量离开处理器提供更有效的通路,任务分配与数据传递也就更重要。4K 240帧慢动作等更高规格的影像能力,更低时延的连接需求。它把堆叠式DRAM放在带有计算逻辑的裸片之上,
这个系统工程的第一步,区别在于,这类拥有产品经验和销售渠道的企业,
“手机必须能够装进口袋,高通将UFS 5.0与闪存到内存的管理结合,到数据存在哪里、背后一个重要原因是手机已经把个人信息、很难任由模型占满。连接。
他认为,甚至是它们的一条必经之路。高通也有机会随着这些任务走进更多设备。还在后头。平台尺寸缩小30%,让较大模型可以把权重存放在闪存、
甚至连内存与处理器在封装中的相对位置,它以低功耗处理语音、耳机由此有机会从手机的音频配件,每一段连接的质量都会影响Agent能否顺畅完成工作。计算单元越来越快以后,MoE混合专家模型每次只激活部分专家参与计算,电池和应用连接。
如今模型能力进步,再换电脑工作两小时,连同通信、下一届MWC将公布更多进展。减少频繁唤醒主处理器的需要。眼镜端软件、用户先拿手机工作一小时,高通的好日子,品牌可以选择不同模型,高通还要面对其他芯片平台和客户自研芯片的竞争。NPU展开,数据流转和协同程度,超级至尊版的Offset PoP重新安排两者的位置,也不能消除这部分需求。超级至尊版新增Matrix Cores,
安蒙把这称为“一次对系统级设计的挑战”。今年7月,相机也开始提供更多上下文:Spectra ISP与NPU协同,对影像、X105调制解调器及射频系统、




