在无限的平面上,机器人最初位于 (0, 0) 处,面朝北方。注意: 机器人可以接受下列三条指令之一: 机器人按顺序执行指令 instructions,并一直重复它们。 只有在平面中存在环使得机器人永远无法离开时,返回 true。否则,返回 false。 示例 1: 输入:instructions = "GGLLGG" 输出:true 解释:机器人最初在(0,0)处,面向北方。 “G”:移动一步。位置:(0,1)方向:北。 “G”:移动一步。位置:(0,2).方向:北…
在无限的平面上,机器人最初位于 (0, 0) 处,面朝北方。注意: 机器人可以接受下列三条指令之一: 机器人按顺序执行指令 instructions,并一直重复它们。 只有在平面中存在环使得机器人永远无法离开时,返回 true。否则,返回 false。 示例 1: 输入:instructions = "GGLLGG" 输出:true 解释:机器人最初在(0,0)处,面向北方。 “G”:移动一步。位置:(0,1)方向:北。 “G”:移动一步。位置:(0,2).方向:北…
最近开始使用 pi 的 coding agent,发现没法通过 shift+tab 来调整 effort level 到 xhigh 和 max,pi 的 settings 里也没有 让 pi 自己解决,很快就好了 直接把 thinkingLevelMap 放在模型对象下,并且在 max 键上也做映射(否则 max 级别不会出现): 然后 /reload 就好了
我们在海光 Z100 DCU (gfx906) 上对 vLLM 推理框架的 CUDA Graph 功能进行了完整的测试验证。本文记录开启 CUDA Graph + torch.compile 的具体配置、性能数据和关键发现。 测试环境 项目 详情 服务器 scnet GPU 1x 海光 Z100 DCU (gfx906), 16 GiB Python 3.10.12 PyTorch 2.10.0+das.opt1.dtk2604 vLLM 0.18.1+das.3266200.dtk2604 Triton 3.4.…
环境信息 项目 详情 GPU 4× 海光 Z100 DCU,每张 16GB,合计 64GB GPU 架构 gfx906 (Vega 20 / GCN 5.1) DTK 版本 DTK 26.04 (DCC2602-0317) Python 3.10.12 PyTorch 2.10.0+das.opt1.dtk2604 vLLM 0.18.1+das.3266200.dtk2604 Triton 3.4.0(从源码编译,替换原 3.4.0+git1ef59765) transformers 5.5.0 flash_at…
最近社区都在说 Muon 用在 LLM 上的训练效果要比 AdamW 好很多,这里根据 Kimi 的论文(http://arxiv.org/abs/2502.16982)和仓库做了一些尝试。 选用模型:minimind,Github 链接:https://github.com/jingyaogong/minimind 硬件:AutoDL自己租个 nv 的卡就行 常见的 AdamW 优化器就是在 Adam 的基础上在梯度更新时加上梯度衰减,这样的话可以避免更新的时候产生更大的参数。 而 Muon …
无论是打数模还是单纯的搞机器学习,都需要对最后训练结果进行分析,这时候常用的四个指标:准确率、召回率、精确率、F1分数。 作为指标,一定会涉及几个方面 假设: TP (预测正确):30个FN (漏检):10个FP (误认为是):15个TN (预测正确不是):45个 这四个指标可以形成一个混淆矩阵: 1️⃣准确率 (Accuracy) 所有预测结果中,预测正确的比例 最直观的指标,但在数据不平衡时表现不佳 2️⃣精确率 (Precision) 模型所有预测为“苹果”的结果中,有多少是真正的苹果公式:是“预测的准不准”…
一、基本概念 最优化:首先是一种理念,其次才是一种方法,它所追求的是一种“至善”之道,一种追求卓越的精神。例子:小明同学,烧一壶水要8分钟,灌开水要1分钟,取牛奶和报纸要5分钟,整理书包要6分钟,为了尽快做完这些事,怎样安排才能使时间最少?最少需要几分钟? 最优化问题的数学模型的一般形式为: \begin{align*} &\text{opt } z = f(x) \\ &\text{s.t. } h_i(x) = 0, \quad i = 1, \cdots, l \\ &\qquad g…
线性回归模型,它是统计学和机器学习中最基础、最核心的预测模型之一,主要用于解决回归问题,即预测一个连续的数值型输出。 核心思想:建立“输入”与“输出”之间的线性关系 线性回归的核心目标非常直观:假设并建模目标变量 y(因变量、输出)与一个或多个预测变量 x(自变量、特征、输入)之间存在的线性关系。 它试图找到一条(简单线性回归)或一个平面/超平面(多元线性回归)来“最佳”拟合数据点,从而当我们知道 x 的值时,就可以基于这条线/平面预测 …