leetcode 复健:1041

在无限的平面上,机器人最初位于 (0, 0) 处,面朝北方。注意: 北方向 是y轴的正方向。 南方向 是y轴的负方向。 东方向 是x轴的正方向。 西方向 是x轴的负方向。 机器人可以接受下列三条指令之一: ...

August 1, 2026 · 3 min

pi agent 不显示 xhigh 和 max 的解决方法

最近开始使用 pi 的 coding agent,发现没法通过 shift+tab 来调整 effort level 到 xhigh 和 max,pi 的 settings 里也没有 让 pi 自己解决,很快就好了 直接把 thinkingLevelMap 放在模型对象下,并且在 max 键上也做映射(否则 max 级别不会出现): ...

July 28, 2026 · 1 min

Z100 DCU 上 vLLM CUDA Graph 推理优化实践

我们在海光 Z100 DCU (gfx906) 上对 vLLM 推理框架的 CUDA Graph 功能进行了完整的测试验证。本文记录开启 CUDA Graph + torch.compile 的具体配置、性能数据和关键发现。 测试环境 项目 详情 服务器 scnet GPU 1x 海光 Z100 DCU (gfx906), 16 GiB Python 3.10.12 PyTorch 2.10.0+das.opt1.dtk2604 vLLM 0.18.1+das.3266200.dtk2604 Triton 3.4.0 模型 Qwen3.5-4B (BF16) 两种配置对比 Baseline:enforce_eager=True(禁用 CUDA Graph) compilation_config.mode = CompilationMode.NONE cudagraph_mode = CUDAGraphMode.NONE 启用 custom fusions(norm_quant、act_quant) 模型加载时间:~125s 显存占用:~13.25 GiB CUDA Graph + Compile:enforce_eager=False compilation_config.mode = VLLM_COMPILE(Inductor backend) cudagraph_mode = FULL_AND_PIECEWISE compile_ranges_endpoints: [8192] cudagraph_capture_sizes: [1, 2] 禁用 custom fusions(与 compile 不兼容) 模型加载时间:~172s(编译开销) 显存占用:~14.5 GiB(多出 ~1.3 GiB 用于 Graph 缓冲) 关键:CUDA Graph 模式不要传 –enforce-eager,去掉该参数后 vLLM 自动启用 VLLM_COMPILE + FULL_AND_PIECEWISE CUDA Graph。 ...

June 15, 2026 · 3 min

海光 Z100 DCU 适配 vLLM 运行 Qwen3.5-27B 完整总结

环境信息 项目 详情 GPU 4× 海光 Z100 DCU,每张 16GB,合计 64GB GPU 架构 gfx906 (Vega 20 / GCN 5.1) DTK 版本 DTK 26.04 (DCC2602-0317) Python 3.10.12 PyTorch 2.10.0+das.opt1.dtk2604 vLLM 0.18.1+das.3266200.dtk2604 Triton 3.4.0(从源码编译,替换原 3.4.0+git1ef59765) transformers 5.5.0 flash_attn 2.8.3+das 上述镜像可以去海光社区:https://developer.sourcefind.cn/modelzoo/list/qwen3.5_vllm/detail?post_id=46176b42-0c0b-11f1-a49f-0242ac150003 获得 ...

June 8, 2026 · 6 min

训练小参数LLM将优化器从AdamW换成Muon的尝试

最近社区都在说 Muon 用在 LLM 上的训练效果要比 AdamW 好很多,这里根据 Kimi 的论文(http://arxiv.org/abs/2502.16982)和仓库做了一些尝试。 选用模型:minimind,Github 链接:https://github.com/jingyaogong/minimind ...

May 31, 2026 · 2 min

各种距离算法小记

最近在翻一些距离算法并考虑他们的GPU并行化实现,记录一下。 这里从图片转成向量开始,利用opencv配合torchvision,转成tensor还是比较容易的。 import cv2 import torchvision.transforms.functional as F import torchvision.transforms as T image = cv2.imread('test_pic1.png') print(type(image),image.shape) img1 = F.to_tensor(image) print(type(img1),img1.shape) print(img1) ...

October 7, 2025 · 6 min

Accuracy、Recall、Precission、F1 Score分别是什么?

无论是打数模还是单纯的搞机器学习,都需要对最后训练结果进行分析,这时候常用的四个指标:准确率、召回率、精确率、F1分数。 作为指标,一定会涉及几个方面 用来描述什么 如何计算的 指标的意义是什么 那为了计算这几个指标,我们需要了解什么是TP、TN、FP、FN 用识别苹果举例 假设我们有100张照片: 其中有40张是真的苹果照片称之为正样本。 另外60张不是苹果照片称之为负样本。 模型预测可能有四种情况: 预测是苹果,实际是苹果,TruePositive (TP) 预测是苹果,实际不是苹果,FalsePositive (FP) 预测不是苹果,实际是苹果,FalseNegative (FN) 预测不是苹果,实际也不是苹果,TrueNegative (TN) True or False =有没有猜对 Positive or Negative 表示猜的结果 是不是正类,是苹果为正类。 假设: ...

September 28, 2025 · 2 min

理解PID控制算法

PID控制算法,可以将其看作是一个 “不断尝试缩小目标与现状之间差距”的智能调节器。它广泛应用于工业控制(如温度、压力、流量控制)、机器人、自动驾驶、无人机稳定系统等需要精确调节物理量的场景。 ...

June 29, 2025 · 5 min

数学建模笔记-最优化问题

一、基本概念 最优化:首先是一种理念,其次才是一种方法,它所追求的是一种“至善”之道,一种追求卓越的精神。 例子:小明同学,烧一壶水要8分钟,灌开水要1分钟,取牛奶和报纸要5分钟,整理书包要6分钟,为了尽快做完这些事,怎样安排才能使时间最少?最少需要几分钟? ...

June 28, 2025 · 7 min

线性回归&Logistic Model

线性回归模型,它是统计学和机器学习中最基础、最核心的预测模型之一,主要用于解决回归问题,即预测一个连续的数值型输出。 核心思想:建立“输入”与“输出”之间的线性关系 线性回归的核心目标非常直观:假设并建模目标变量 y(因变量、输出)与一个或多个预测变量 x(自变量、特征、输入)之间存在的线性关系。 ...

June 17, 2025 · 6 min