RobinDevNotes

1
获赞数
1
关注数
0
粉丝数
IP 属地广东
2024-11-01 加入
浏览 1.5k

公众号:RobinDevNotes

1 声望
云原生
0
kubernetes
0
人工智能
0
黄金勋章
暂未获得该勋章
如何获得
1 白银勋章
个人动态
  • 发布了文章9 月 16 日
    用 Profile 揪出大模型训练性能瓶颈
    大模型训练"跑起来"和"跑得快"完全是两回事——同样的模型、同样的卡数,GPU 利用率可能相差一倍以上,原因往往藏在计算、通信、IO 三个环节里,肉眼很难判断到底卡在哪一步。Nsight Systems 和 PyTorch Profiler 是目前工程实践中最常用的一对性能分析工具,前者看系...
  • 发布了文章9 月 14 日
    TensorRT 与 ONNX Runtime 推理全解析
    大模型从训练好的权重变成能对外提供服务的产品,中间必须经过"推理引擎"这一关。TensorRT(及其大模型分支 TensorRT-LLM)和 ONNX Runtime(及其生成式扩展 ONNX Runtime GenAI)是目前工程落地中最常被提到的两套推理方案,一个主打 NVIDIA GPU 上的极致性能,一个...
  • 发布了文章9 月 12 日
    Palmier Pro:AI时代的Mac视频编辑器
    Palmier Pro 是一款为 Mac 打造的 AI 视频编辑器,用纯 Swift 原生开发,目标是做出"给 AI 智能体用的 Premiere Pro"。它把时间线剪辑和生成式 AI 揉进了同一个工作界面:可以在剪辑轨道里直接调用 Seedance、Kling、Nano Banana Pro 等模型生成素材,也可以把 Claud...
  • 发布了文章9 月 11 日
    模型训练工程师必须搞懂的DDP和FSDP
    当模型大到一张 GPU 装不下、或者数据多到一张卡跑不动的时候,PyTorch 提供了两套分布式训练方案来解决这个问题:DDP(DistributedDataParallel)和 FSDP(FullyShardedDataParallel)。它们都不是独立的框架,而是 PyTorch 内置的分布式训练技术,分别代表了"数据...
  • 发布了文章9 月 8 日
    为什么AI训练工程师都要懂NCCL
    训练一个大模型,从来不是一张卡的事情。当成百上千张 GPU 需要在每一步训练中同步梯度、对齐参数时,真正决定训练效率上限的,往往不是算力本身,而是"卡与卡之间怎么说话"。NCCL(NVIDIA Collective Communications Library)就是解决这件事的核心组件——它是几乎所...
  • 发布了文章9 月 6 日
    RoCEv2如何扛起大模型训练网络
    大模型训练早已不是"堆 GPU"就能解决的问题:成百上千张卡之间的梯度同步(All-Reduce、All-Gather)对网络的带宽、时延和丢包率极度敏感,网络反而成了压榨算力的最后一道瓶颈。RoCEv2(RDMA over Converged Ethernet v2)把 RDMA 的低时延、低 CPU 开销能力搬到了...
  • 发布了文章9 月 3 日
    开源游戏引擎Godot正在悄然崛起
    Godot 是一款完全免费、开源、跨平台的 2D/3D 游戏引擎,采用 MIT 协议,没有任何授权费、分成或订阅门槛。自 2023 年 Unity 的"运行时收费"风波之后,越来越多独立开发者把目光投向了它,如今它已经从"小众替代品"变成了独立游戏圈里一个真正拿得出手的主力选项。
  • 发布了文章8 月 26 日
    Omarchy:最美AI Linux发行版
    Omarchy 是 Ruby on Rails 作者、37signals 联合创始人兼 CTO DHH(David Heinemeier Hansson)主导的一款 Linux 发行版,核心思路很简单:把"Arch Linux + Hyprland 平铺式窗口管理器"这套公认强大但配置极其繁琐的组合,预先装好、配好、美化好,让你一条命令或一...
  • 发布了文章8 月 23 日
    K8s+Megatron-LM+vLLM打通超大模型训练全链路
    Megatron-LM 是 NVIDIA 开源的大模型训练库,核心是张量并行(TP)、流水线并行(PP)等模型并行技术——和前两篇讲的 Ray、DeepSpeed 不同,它解决的不是"怎么调度"或"怎么省显存",而是"单个模型本身大到一张卡、甚至一台机器都装不下"这个更底层的问题。这篇文章先...
  • 发布了文章8 月 19 日
    K8s+DeepSpeed+vLLM打通大模型训练到上线全链路
    DeepSpeed 是微软开源的分布式训练优化库,核心是 ZeRO 显存切分技术,最近两年在大模型岗位的招聘要求里出现得越来越频繁——但网上大多数介绍停留在"ZeRO 三个 stage 分别切什么",很少讲清楚它在一条完整生产链路里具体怎么落地。这篇文章接着上一篇 K8s+Ray+PyTorc...
  • 发布了文章8 月 13 日
    K8s+Ray+vLLM打穿大模型全生命周期(有实践步骤)
    K8s + Ray + PyTorch + vLLM 是当前大模型工程里出现频率很高的一套组合,但网上大多数文章只谈"为什么好",很少给出真正能跑、能验证的完整链路。这篇文章分两部分:先做定位分析——四个组件到底各自解决什么问题、边界在哪里;再给出一条贯穿数据处理、预训练、后训...
  • 发布了文章8 月 10 日
    Orca让多个AI编程智能体并行工作
    Orca 是一款面向"百倍效率开发者"的 AI 编排工具(ADE),核心思路是让 Claude Code、Codex、OpenCode、Pi 等任意命令行 AI 编程智能体在各自独立的 Git worktree 中并行运行,并集中在一个界面里管理。它不锁定某一家模型厂商,而是用你已有的订阅去调度你已经在用...
  • 发布了文章8 月 8 日
    轻量级动画引擎Anime.js迎来V4大版本更新
    Anime.js 是一个轻量、快速、多面手的 JavaScript 动画引擎,一套简单的 API 就能同时驱动 CSS 属性、SVG、DOM 属性和普通 JS 对象的动画。V4 是一次彻底的架构升级:从单一的 anime() 函数,扩展成了一整套围绕时间线、拖拽、滚动触发、文字特效的模块化工具集,同...
  • 发布了文章8 月 4 日
    开源AI渗透测试智能体自动验证真实漏洞
    Strix 是一款开源的 AI 渗透测试工具,用一组能像真实黑客一样工作的自主智能体,动态运行你的代码、发现漏洞,并通过真实的漏洞利用(PoC)来验证——而不是像传统静态扫描工具那样只给出一堆待人工复核的疑似告警。它面向需要快速、准确安全测试的开发者和安全团队,...
  • 发布了文章7 月 31 日
    开源AI会议助手让转录数据不出本地
    Meetily 是一款完全在本地运行的开源 AI 会议助手:实时转录、生成摘要全部在自己的电脑上完成,不需要把录音和文字稿传到任何服务器。项目用 Rust 打底,前端基于 Tauri + Next.js,转录引擎支持 Whisper 和 Parakeet 两种模型,摘要生成默认接入本地的 Ollama,也...
  • 发布了文章7 月 27 日
    英伟达神卡破解后最高飙升到80G显存
    2021年英伟达发布过一张"阉割版A100"——专供挖矿的 CMP 170HX,核心芯片跟数据中心神卡 A100 是同一颗 GA100,却被固件锁得只剩十分之一实力。2026年,硬件安全研究者用一个固件级漏洞把它的算力和显存几乎全部解封:FP32 提升 31 倍、FP64 提升近 60 倍、显存从 10G ...
  • 发布了文章7 月 21 日
    Pi:不止编程,一套通用 Agent 框架
    Pi 是 earendil-works 开源的 Agent 开发框架,很容易被"pi 命令行编程工具"这个第一印象带偏——它把"统一多模型 LLM API、通用 Agent 运行时、终端 UI、编程 Agent CLI"拆成四个独立又能组合使用的包,真正的通用能力在 pi-agent-core 这一层:一个带工具调用、状态...
  • 发布了文章7 月 16 日
    AI Boardroom:把投研团队装进终端
    AI Boardroom 是一套跑在 Claude Code 终端里的美股投研与交易 skill 集合:不用写代码,靠自然语言就能查持仓、看K线、盯盘、跑AI委员会辩论、拿期权策略建议、找低估标的,还能直接下单和一键止损。它把过去分散在行情软件、研报、期权计算器里的动作,收进了一个...
  • 发布了文章7 月 15 日
    一句话写稿配图,自动发全网平台
    多平台分发内容的人都遇到过同一个麻烦:一篇稿子写完,还要手动改格式、传封面、逐个平台粘贴发布,一圈下来比写稿本身还耗时间。write-blog 是运行在 Claude Code 里的一个写作发布 skill,一句话或一个链接就能生成成稿、配好封面图和知识总结图,再自动把草稿铺...
  • 发布了文章7 月 13 日
    uv:终结 Python 虚拟环境管理乱局
    如果你还在 python -m venv .venv && source .venv/bin/activate && pip install -r requirements.txt 这套流程里反复横跳,是时候看看 uv 了。uv 是 Astral(Ruff、ty 的作者)用 Rust 写的 Python 包与项目管理工具,把版本管理、依赖安装、锁文件...