发布了文章9 月 16 日
大模型训练"跑起来"和"跑得快"完全是两回事——同样的模型、同样的卡数,GPU 利用率可能相差一倍以上,原因往往藏在计算、通信、IO 三个环节里,肉眼很难判断到底卡在哪一步。Nsight Systems 和 PyTorch Profiler 是目前工程实践中最常用的一对性能分析工具,前者看系...
发布了文章9 月 14 日
大模型从训练好的权重变成能对外提供服务的产品,中间必须经过"推理引擎"这一关。TensorRT(及其大模型分支 TensorRT-LLM)和 ONNX Runtime(及其生成式扩展 ONNX Runtime GenAI)是目前工程落地中最常被提到的两套推理方案,一个主打 NVIDIA GPU 上的极致性能,一个...
发布了文章9 月 12 日
Palmier Pro 是一款为 Mac 打造的 AI 视频编辑器,用纯 Swift 原生开发,目标是做出"给 AI 智能体用的 Premiere Pro"。它把时间线剪辑和生成式 AI 揉进了同一个工作界面:可以在剪辑轨道里直接调用 Seedance、Kling、Nano Banana Pro 等模型生成素材,也可以把 Claud...
发布了文章9 月 11 日
当模型大到一张 GPU 装不下、或者数据多到一张卡跑不动的时候,PyTorch 提供了两套分布式训练方案来解决这个问题:DDP(DistributedDataParallel)和 FSDP(FullyShardedDataParallel)。它们都不是独立的框架,而是 PyTorch 内置的分布式训练技术,分别代表了"数据...
发布了文章9 月 8 日
训练一个大模型,从来不是一张卡的事情。当成百上千张 GPU 需要在每一步训练中同步梯度、对齐参数时,真正决定训练效率上限的,往往不是算力本身,而是"卡与卡之间怎么说话"。NCCL(NVIDIA Collective Communications Library)就是解决这件事的核心组件——它是几乎所...
发布了文章9 月 6 日
大模型训练早已不是"堆 GPU"就能解决的问题:成百上千张卡之间的梯度同步(All-Reduce、All-Gather)对网络的带宽、时延和丢包率极度敏感,网络反而成了压榨算力的最后一道瓶颈。RoCEv2(RDMA over Converged Ethernet v2)把 RDMA 的低时延、低 CPU 开销能力搬到了...
发布了文章9 月 3 日
Godot 是一款完全免费、开源、跨平台的 2D/3D 游戏引擎,采用 MIT 协议,没有任何授权费、分成或订阅门槛。自 2023 年 Unity 的"运行时收费"风波之后,越来越多独立开发者把目光投向了它,如今它已经从"小众替代品"变成了独立游戏圈里一个真正拿得出手的主力选项。
发布了文章8 月 26 日
Omarchy 是 Ruby on Rails 作者、37signals 联合创始人兼 CTO DHH(David Heinemeier Hansson)主导的一款 Linux 发行版,核心思路很简单:把"Arch Linux + Hyprland 平铺式窗口管理器"这套公认强大但配置极其繁琐的组合,预先装好、配好、美化好,让你一条命令或一...
发布了文章8 月 23 日
Megatron-LM 是 NVIDIA 开源的大模型训练库,核心是张量并行(TP)、流水线并行(PP)等模型并行技术——和前两篇讲的 Ray、DeepSpeed 不同,它解决的不是"怎么调度"或"怎么省显存",而是"单个模型本身大到一张卡、甚至一台机器都装不下"这个更底层的问题。这篇文章先...
发布了文章8 月 19 日
DeepSpeed 是微软开源的分布式训练优化库,核心是 ZeRO 显存切分技术,最近两年在大模型岗位的招聘要求里出现得越来越频繁——但网上大多数介绍停留在"ZeRO 三个 stage 分别切什么",很少讲清楚它在一条完整生产链路里具体怎么落地。这篇文章接着上一篇 K8s+Ray+PyTorc...
发布了文章8 月 13 日
K8s + Ray + PyTorch + vLLM 是当前大模型工程里出现频率很高的一套组合,但网上大多数文章只谈"为什么好",很少给出真正能跑、能验证的完整链路。这篇文章分两部分:先做定位分析——四个组件到底各自解决什么问题、边界在哪里;再给出一条贯穿数据处理、预训练、后训...
发布了文章8 月 10 日
Orca 是一款面向"百倍效率开发者"的 AI 编排工具(ADE),核心思路是让 Claude Code、Codex、OpenCode、Pi 等任意命令行 AI 编程智能体在各自独立的 Git worktree 中并行运行,并集中在一个界面里管理。它不锁定某一家模型厂商,而是用你已有的订阅去调度你已经在用...
发布了文章8 月 8 日
Anime.js 是一个轻量、快速、多面手的 JavaScript 动画引擎,一套简单的 API 就能同时驱动 CSS 属性、SVG、DOM 属性和普通 JS 对象的动画。V4 是一次彻底的架构升级:从单一的 anime() 函数,扩展成了一整套围绕时间线、拖拽、滚动触发、文字特效的模块化工具集,同...
发布了文章8 月 4 日
Strix 是一款开源的 AI 渗透测试工具,用一组能像真实黑客一样工作的自主智能体,动态运行你的代码、发现漏洞,并通过真实的漏洞利用(PoC)来验证——而不是像传统静态扫描工具那样只给出一堆待人工复核的疑似告警。它面向需要快速、准确安全测试的开发者和安全团队,...
发布了文章7 月 31 日
Meetily 是一款完全在本地运行的开源 AI 会议助手:实时转录、生成摘要全部在自己的电脑上完成,不需要把录音和文字稿传到任何服务器。项目用 Rust 打底,前端基于 Tauri + Next.js,转录引擎支持 Whisper 和 Parakeet 两种模型,摘要生成默认接入本地的 Ollama,也...
发布了文章7 月 27 日
2021年英伟达发布过一张"阉割版A100"——专供挖矿的 CMP 170HX,核心芯片跟数据中心神卡 A100 是同一颗 GA100,却被固件锁得只剩十分之一实力。2026年,硬件安全研究者用一个固件级漏洞把它的算力和显存几乎全部解封:FP32 提升 31 倍、FP64 提升近 60 倍、显存从 10G ...
发布了文章7 月 21 日
Pi 是 earendil-works 开源的 Agent 开发框架,很容易被"pi 命令行编程工具"这个第一印象带偏——它把"统一多模型 LLM API、通用 Agent 运行时、终端 UI、编程 Agent CLI"拆成四个独立又能组合使用的包,真正的通用能力在 pi-agent-core 这一层:一个带工具调用、状态...
发布了文章7 月 16 日
AI Boardroom 是一套跑在 Claude Code 终端里的美股投研与交易 skill 集合:不用写代码,靠自然语言就能查持仓、看K线、盯盘、跑AI委员会辩论、拿期权策略建议、找低估标的,还能直接下单和一键止损。它把过去分散在行情软件、研报、期权计算器里的动作,收进了一个...
发布了文章7 月 15 日
多平台分发内容的人都遇到过同一个麻烦:一篇稿子写完,还要手动改格式、传封面、逐个平台粘贴发布,一圈下来比写稿本身还耗时间。write-blog 是运行在 Claude Code 里的一个写作发布 skill,一句话或一个链接就能生成成稿、配好封面图和知识总结图,再自动把草稿铺...
发布了文章7 月 13 日
如果你还在 python -m venv .venv && source .venv/bin/activate && pip install -r requirements.txt 这套流程里反复横跳,是时候看看 uv 了。uv 是 Astral(Ruff、ty 的作者)用 Rust 写的 Python 包与项目管理工具,把版本管理、依赖安装、锁文件...