ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

第319篇 嵌入式ARM架构与编程

第319篇 嵌入式ARM架构与编程 从这篇开始进入嵌入式系列。前面聊了实时系统、RTOS、Linux PREEMPT_RT这些知识在嵌入式平台上都要落地。嵌入式ARM是机器人中最常用的处理器架构理解ARM的编程模型对机器人软件开发非常重要。ARM处理器家族ARM处理器按应用场景分为几个系列。Cortex-M系列微控制器MCU面向低成本、低功耗的嵌入式应用。Cortex-M0/M0是最简单的适合传感器节点。Cortex-M3/M4是主流适合电机控制、机器人底层控制。Cortex-M7性能最强可以跑一些简单的AI推理。常见的芯片STM32M3/M4/M7、NXP LPCM0/M3/M4。Cortex-R系列实时处理器面向需要硬实时保证的应用。汽车电子ABS、ESP、硬盘控制器、网络设备。Cortex-R5/R5F在汽车领域用得非常多支持锁步运行双核同步执行检测硬件错误。Cortex-A系列应用处理器面向需要运行操作系统的复杂应用。机器人中的上位机通常用Cortex-A比如Jetson的Cortex-A78AE、树莓派的Cortex-A72。可以跑Linux、Android等通用操作系统。在机器人中典型的架构是Cortex-A跑Linux做感知和规划Cortex-M4/M7跑FreeRTOS做电机控制和传感器采集。两者之间通过SPI或UART通信。ARM的编程模型ARM是RISC精简指令集架构。指令长度固定ARM模式32位Thumb模式16位寄存器数量多16个通用寄存器Load-Store结构只有LDR/STR能访问内存运算指令只能操作寄存器。ARM有多种指令集状态。ARM状态32位指令性能最好。Thumb状态16位指令代码密度更高适合Flash空间受限的场景。Thumb-2混合了16位和32位指令兼顾代码密度和性能。Cortex-M只支持Thumb-2。浮点运算方面Cortex-M4/M7有可选的FPU浮点运算单元。如果用了FPU编译时要加-mfpufpv4-sp-d16 -mfloat-abihard标志。否则浮点运算会用软件模拟速度慢10到100倍。在控制算法中PID、卡尔曼滤波浮点性能很关键一定要用硬件FPU。Cortex-M7还支持双精度浮点DP FPU而M4只支持单精度。如果你的算法需要双精度比如高精度定位要选M7或者确保算法在单精度下足够准确。DSP指令也是嵌入式ARM的一个重要特性。Cortex-M4/M7有SIMD指令SATD、SMLAD等可以加速数字信号处理任务。比如FFT、FIR滤波器、矩阵运算等。编译时用-mcpucortex-m4 -O3编译器会自动使用DSP指令。你也可以用CMSIS-DSP库——ARM官方提供的优化过的信号处理函数库。电源管理模式也值得了解。Cortex-M支持多种低功耗模式SleepCPU停止外设运行、Stop所有时钟停止RAM保持、Standby几乎全部断电只保留备份寄存器。在电池供电的机器人中合理管理功耗模式可以显著延长续航。但要注意从Stop和Standby模式唤醒需要时间几微秒到几毫秒频繁进出低功耗模式反而可能增加功耗。中断和异常ARM的中断系统叫NVICNested Vectored Interrupt Controller在Cortex-M中集成在芯片内部。NVIC支持可编程的优先级最多256级、中断嵌套、尾链tail chaining连续中断不需要保存恢复上下文。中断优先级分两组抢占优先级和子优先级。抢占优先级高的可以打断低的。子优先级只在两个中断同时挂起时起作用决定谁先执行。STM32中通常把优先级分组设为4位抢占0位子优先级简单直接。// STM32中断优先级配置示例 HAL_NVIC_SetPriority(USART1_IRQn, 1, 0); // 抢占优先级1 HAL_NVIC_EnableIRQ(USART1_IRQn); // 在ISR中尽量短小 void USART1_IRQHandler(void) { if (USART1-SR USART_SR_RXNE) { uint8_t data USART1-DR; // 读数据清中断标志 ring_buffer_push(rx_buf, data); } }中断延迟是实时系统的关键指标。Cortex-M的中断延迟通常是12个时钟周期从硬件中断触发到ISR第一条指令执行。在168MHz的STM32F4上这大约是70纳秒。非常快。但如果ISR中调用了操作系统API比如释放信号量延迟会增加。内存映射和外设访问ARM Cortex-M的外设通过内存映射访问——每个外设都有一组寄存器映射到固定的内存地址。操作外设就是读写这些寄存器。// 直接操作GPIO寄存器STM32 #define GPIOA_BASE 0x40020000 #define GPIOA_ODR (*(volatile uint32_t*)(GPIOA_BASE 0x14)) // 点亮PA5引脚的LED GPIOA_ODR | (1 5); // 设置PA5为高电平 GPIOA_ODR ~(1 5); // 设置PA5为低电平volatile关键字在嵌入式编程中非常重要。它告诉编译器不要优化对这个变量的读写——每次都要从内存地址重新读取。外设寄存器的值可能被硬件改变比如状态寄存器如果不加volatile编译器可能缓存旧值导致程序行为错误。位带Bit-Band操作是Cortex-M的一个特色功能。它允许你用一个普通的32位写操作来修改单个位而不需要读-改-写的序列。这在需要原子地修改单个控制位时很有用。面试要点ARM Cortex-M和Cortex-A的区别。Cortex-M是MCU跑RTOS或裸机程序中断延迟低几十纳秒功耗低。Cortex-A是应用处理器跑Linux/Android有MMU支持虚拟内存性能高但延迟不确定。面试时能根据应用需求选择合适的处理器系列。volatile的作用。在嵌入式中volatile用于外设寄存器、中断服务程序中修改的全局变量、多线程共享的标志位。不加volatile可能导致编译器优化掉必要的读写操作。但volatile不保证原子性——多字节变量的读写仍然可能被中断打断。FPU的使用注意事项。编译时要启用硬件浮点-mfloat-abihard。在中断中如果用了浮点运算需要保存和恢复FPU寄存器——Cortex-M4的FPU有32个双字寄存器保存开销不小。如果中断中不用浮点可以设置FPU的懒保存模式lazy stacking只在必要时才保存。DMA的工作原理。DMADirect Memory Access允许外设直接读写内存不需要CPU参与。比如ADC采样时DMA可以自动把采样数据搬到内存缓冲区CPU完全不用管。这在高速数据采集场景中非常重要——没有DMA的话每次采样都要中断CPU开销太大。使用DMA时要注意缓存一致性问题——Cortex-M7有数据缓存D-CacheDMA读写的是物理内存可能跟缓存不一致。需要在DMA传输前后做缓存清理或无效化操作。启动流程也是面试常问的。Cortex-M上电后从向量表的第一项读取初始MSP主栈指针从第二项读取复位向量Reset_Handler的地址。Reset_Handler做基本的硬件初始化时钟、Flash等待状态然后调用SystemInit最后调用main函数。了解启动流程有助于你调试启动阶段的问题比如程序跑不起来、时钟配置不对。给你的建议学习ARM嵌入式编程建议从STM32入手。买一块Nucleo开发板几十块钱用STM32CubeIDE开发。先跑通GPIO、UART、定时器这些基本外设再尝试用FreeRTOS做多任务编程。重点理解内存映射、中断系统、DMA这三个核心概念。它们是嵌入式编程的基础不管你以后用什么芯片这些概念都是通用的。面试时聊ARM核心要展示的是你对底层硬件的理解。不只是会调HAL库的API还要知道寄存器级别的原理、中断系统怎么工作、内存映射怎么访问外设。上一篇第318篇 实时性能分析下一篇预告第320篇 嵌入式C编程实践
返回列表