CoolGPU

寻找乐趣, 寻找生活 — ML / GPU Kernel / 技术笔记

WezTerm kitty graphics 显示不出图片?把这四个坑都排掉

想让 WezTerm 用 kitty graphics 协议显示图片,结果一路踩坑:序列漏下划线、stable 版本实现是坏的、enable_kitty_graphics 默认值误判、term 默认值。附 APC query 探测诊断法和换 nightly 的步骤。

给 AI 编程助手装一个「经验本」:从扩展到 Skill 的进化

用 pi 把“排查经验”自动沉淀成可复用手册。第一版做成扩展插件,弹框问标题/摘要、只生成空模板;意识到提取与总结本就该 agent 干,于是砍掉代码与用户输入,简化成一个 Skill——/skill:lesson 或一句“记一笔”,agent 自动提炼标题/摘要/正文、写入 lesson/ 并把索引置顶插进每次会话自动加载的 AGENTS.md。讲清为什么 Skill 比 extension 更适合“智力在 LLM”的任务。

自建 Paseo Relay:让手机连上内网 AI Agent 的两次踩坑

NAT 后的 Paseo daemon 如何被外网手机访问——自建 relay 的中继架构、零知识转发的设计动机,以及自建 relay 默认不开 TLS 导致 400 的源码级根因排查。

ChatGPT Memory 设计原理:从笔记本到后台综合的演进

全网调研 ChatGPT 记忆系统:从 2024 显式 saved memories,到 2025 chat history 不可见画像,再到 2026 Dreaming V3 后台异步综合。逆向得出的六层上下文结构、时间感知重写机制,以及透明度与安全争议。

沐曦股份趋势分析实战:四阶段+趋势模板+量价背驰拆解 7-7 大涨

以国产 GPU 沐曦股份(688802)为实战案例,用 Weinstein 四阶段、Minervini 趋势模板与量价/MACD 背驰拆解 7-7 大涨——7-7 盘中 876 却收 834,DIF 腰斩,顶背驰+放量滞涨并存。并诚实面对新股长均线缺失的方法论困境。

价值与动量为何天生一对?——解读《Value and Momentum Everywhere》

Asness 等 2013 论文:价值与动量跨八大市场收益为正、彼此负相关(股票约 −0.60),组合夏普 1.45——价值投资者也该懂趋势的学术理由。

2026 上半年 Agent Memory 研究全景:从分块拼接到可学习的记忆技能

梳理 2025–2026 年 LLM Agent Memory 研究:四篇综述打地基,AgeMem/GAM/AutoMem 把记忆管理做成端到端可学习,LongMemEval/Memora/MemBench 补齐评测,治理与安全成为新前线。

EverOS vs ByteRover:两种记忆系统范式的核心设计对比

两个开源记忆系统的核心设计对比:EverOS 走 Markdown-first + 框架自动蒸馏的 bottom-up 路线,ByteRover 走 HTML Context Tree + LLM 自策展的 top-down 路线。并给出 EverOS 值得 ByteRover 借鉴的语义生命周期管理三建议。

ByteRover 深度解读:当 Agent 自己管理记忆

ByteRover 把记忆从外部向量库翻转为 Agent 自身能力:Context Tree + 五层渐进检索,零基础设施 LoCoMo SOTA 96.1%。

Cursor 3.9+ macOS 精简分流:V2rayU + tun2socks 强制 AI 通道走代理

Cursor 3.9+ 的 AlwaysLocal 子进程不认 http.proxy 与 V2rayU 全局模式。记录一套按需分流方案:DoH@SOCKS5 → /etc/hosts → utun2socks 主机路由,仅劫持 Cursor IP,强制 AI 通道经 V2rayU 1080 出境。

2026中国AI智能体大会 · 参会记实

「2026中国AI智能体大会」于7月2日至7月3日在杭州举办。记录开幕式及三场闭门研讨核心收获,含 94 页胶片全集子页,覆盖自进化智能体、Skill 群体进化与 Agent Harness 外化体系。

Windows + tmux + Claude Code:持久化 SSH 会话工作流

在本地 PC(Windows)上用 Claude Code 通过 SSH 连接远程 Linux 开发机时,tmux 在远程机器上保持会话,本地客户端可以随时重连,断开也不会影响远程任务的继续执行。

X 社区热议:Attention Kernel 优化趋势 (2026-05)

Great technical talk by @tedzadouri on FlashAttention-4: a deep look at how attention kernels are being redesigned for NVIDIA Blackwell.

Attention Kernel Optimization 研究报告

封面速览:FlashAttention-4 登顶 Blackwell(1,613 TFLOPs/s),FlashQLA 和 cuLA 代表线性 attention 两条路径,社区掀起手写 attention kernel 热潮。