计算机组成总结

    目前被弃用的存储器磁芯存储器 系统的主存由 RAM 和 ROM 构成 主存由 DRAM 构成(错) 半导体主要由随机存储器构成,并不是所有都采用随机存取的方式进行读写 也可以按内容访问(全相联的cache) 画图例题 见习题册答题部分第4题,还是很有必要弄明白的
    阅读全文

    操作系统原理错题

    一个进程映像是 PCB 数据段和代码 栈 任何时刻都只有一个进程处于运行态 还有可能因为死锁,全部处于阻塞态,而不是运行态。补充一点,死锁的时候也可能没有就绪态的进程 一个进程同一时刻执行多个程序(错) 一个程序可以产生多个进程(对) 操作系统响应请求、长程调度 都会创建新进程 并发进程...
    阅读全文

    指令系统错题

    下列有关指令集体系结构(ISA)的叙述中,错误的是( )。 A. ISA规定了执行每条指令时所包含的控制信号 B. ISA规定了指令获取操作数的方式,即寻址方式 C. ISA规定了所有指令的集合,包括指令格式和操作类型 D. ISA规定了程序可访问的寄存器个数、存储空间大小、编址方式和大端/小端方式 ...
    阅读全文

    Warp Scheduler 如何通过 Verilog 实现

    2025-09-17
    本文主要介绍如何通过 Verilog 设计一个简单的 Warp Scheduler,Warp Scheduler 是 GPU 中用来调度 Warp、 发射指令的模块。 Warp 概念 Warp 可以理解为 一组线程(比如 32 个)。正常情况下,Warp 内的所有线程会执行同一条指令。那么我们为什么需要 War...
    阅读全文

    Minimind 代码解析 2

    2025-08-11
    MoEForward 本文主要介绍 MiniMind 的代码解析,是该系列的第二篇文章。”minimind 是一个著名的开源项目。它没有使用各种高度抽象的接口,为我们展示了训练一个语言模型的细节(没有让细节被隐藏在各种第三方库之下)。因此,它也是入门 LLM 的一个很好的开源项目。 这篇文章解析了部分 minim...
    阅读全文

    Minigpu 如何构建 Tensorcore

    2025-08-11
    本文是 miniGPU 系列的第二篇文章,介绍我们设计的 TensorCore。TensorCore 的主要作用是 在一个周期内实现 FMA 运算。也就是一个乘加运算($D=AB+C$),我们的设计中,TensorCore 处理的是 $4\times 4$ 的矩阵;另一个比较重要的特性是,TensorCore 可...
    阅读全文

    Muzero

    2025-08-06
    MuZero 整体架构 MuZero 是一种强化学习算法,在大名鼎鼎的 AlphaZero 的基础上有一定的突破与改进。MuZero 主要有预测三个函数: 我们首先介绍一些符号,$o^k$ 代表第 k 步观察到的状态,$r^k$ 代表预测第 k 步获得的即时奖励,$s^k$ 代表第 k 步的隐藏状态,$a^...
    阅读全文

    计算机如何实现浮点运算

    2025-07-29
    本文基于 IEEE754 标准,介绍计算机实现 FP32(32 位浮点数)加法、乘法运算的过程,并提供一份 Verilog 实现,因为我并没有仔细推敲,所以我提供的代码可能效率不够高、简洁,仅作参考。 IEEE754标准 在 IEEE754 标准下,32 个比特位被拆分为 符号位(1bit)、指数位(8bit)、...
    阅读全文
    访问 | 访客