Cradle技术公司是仅存的几家倡导对媒体融合应用采用大规模多处理(multiprocessing)的公司之一,它已推出其首款芯片产品3400。该芯片包含8个DSP内核、4个专有的通用RISC内核以及一簇I/O处理资源,它代表了Cradle架构的初级实现。
该架构的目标是视频会议、HDTV机顶盒、高清晰度扫描仪/打印机以及其他需要高密集、流驱动的数字处理并且控制通信量不是很高的应用。针对这些应用的传统方案要么是大型的DSP芯片,要么是具有专用数据通道的ASIC。而与上述传统方案不同,Cradle解决这种计算问题的方法是利用单个芯片上的DSP簇。
一个Cradle DSP簇包括4个多流处理器(multistream processor,MSP),它们共享不是太大但比较快的本地存储器:64KB的数据存储器和32KB的指令存储器。存储器可以配置成高速缓存或本地暂存器,并可由一个基于RISC的存储器转移引擎(MTE)进行管理。MTE有点像一个被加速的DMA控制器。而每个MSP则包括1个通用RISC内核和2个DSP内核。每个DSP都具有自己的小型本地RAM以及地址生成功能。
Cradle最初的实现产品包括了一个这种簇,不过该公司设想在将来的实现中采用多个簇。除计算簇以外,该芯片还包括了一个I/O处理簇,它有2个通用RISC内核、2个MTE以及自己的程序块和数据存储器。align=RIGHT VSPACE=12 HSPACE=12 ALT="图:单个芯片上的DSP簇可实现28个8×8位千兆MAC的计算速度。">
该芯片的输入和输出被设计成几乎和计算资源一样灵活。由小型FIFO和控制状态机支持的通用可编程I/O引脚连到I/O处理簇,为数据源和目的地提供通用I/O。这些引脚还可用于级联器件以提高计算中的并行程度。由于这些引脚以CMOS 3.3伏I/O焊盘的形式实现,因此它们不适合于低电压信令,但除此之外其它方面都很灵活。该芯片提供了一个专用的SDRAM控制器,因此该关键接口无需通过可编程资源来实现。该SDRAM接口拥有自己的FIFO,并且有重新排序功能以便优化对存储器块的存取。
DSP簇、I/O簇、SDRAM控制器以及一系列的信号量和同步器件,所有这些资源都通过共享的全局片上总线互相连接起来。
但Cradle指出,这并不是一种通用的计算架构。它也不是对称多处理的变种或是更小的大规模并行超级计算机。它是一种专门针对这样一些应用,即在这些应用中,数据是以有序流的形式到达,需要面向流的、无需频繁改变前后关系的信号处理,并且很容易通过利用数据中内在的并行性被分解成若干子数据流(substream)。
所有这类架构兴亡的关键,都在于其编程工具将实际应用纳入架构预想概念的能力。因此,Cradle已在其开发工具上进行了大量投入。它有一个基本的工具集可为各种引擎提供与C语言层次相当的编程性,它是基于ANSI C和GNU库。同时提供的还有一个专有的eCOS操作系统。而可能更重要的是,该公司已开发了一个周期准确的全芯片仿真器,并已联锁(interlock)了一系列调试工具,它们使得开发人员不仅可以察看代码在引擎上的执行,还可以查看各个簇之间经全局总线的交互过程。
而一个第二层软件则瞄准了两个特定应用领域的新芯片。Cradle已最先为两种目标应用(即视频处理和打印机图像处理)编译了无需专利费的应用程序组件模块。这些组件包括视频编解码器、TCP/IP协议堆、RTP以及用于视频处理的CCD校准和图像增强算法。
该芯片配备的软件有两个版本供选择:ECE 3400带有视频通信软件包,而MPE 3400则带有打印机处理包。
该芯片是用150纳米工艺实现的,处理器簇运行于220MHz的时钟。全局总线时钟设在300 MHz。在这个速度下,Cradle估计该芯片的最高计算速度相当于28个8×8位千兆MAC。该芯片在1.2伏时的典型功耗为3瓦。
作者:张国勇








京公网安备 11011202001138号
