论文汇总
汇总本站发布过的全部论文调研,共 106 篇,按领域与年份整理。覆盖多模态、模型训练、图像分类、目标检测/分割、图像检索、OCR、人脸检测/识别、模型蒸馏/剪枝、视频识别/压缩等 13 个方向。
汇总本站发布过的全部论文调研,共 106 篇,按领域与年份整理。覆盖多模态、模型训练、图像分类、目标检测/分割、图像检索、OCR、人脸检测/识别、模型蒸馏/剪枝、视频识别/压缩等 13 个方向。
距离上次搭建Hexo/NexT博客网站已过去四年,整体交互体验没有颠覆性变化,交互细节与部署实现倒是一直在打磨。这一次用最新版本(hexo 8.1.1 / NexT 8.26.0)重新构建,结合Docker、Github Action/Pages、Gitea Actions/Nginx等工具优化整个部署PIPELINE。
V2 的四阶段流水线运行了几个月,分类体系依旧达不到理想状态:LLM 生成的中性命名缺少个人味道,类别粒度也和博客定位对不齐。V3 把 LLM 的职责从「生成体系」收缩到「从固定词表选标签」,类别分配改成零 API 的机械规则,用 taxonomy.json 固化 21 个类别和 239 个标签。本文记录这次推倒重来的完整过程:两级层级设计、四轮迁移 424 篇文章和踩到的几个坑。
skill 机制把工作流知识按需注入上下文,解决了 CLAUDE.md 全量加载与低频流程常驻之间的矛盾。本文以 claude-skills 仓库(maestro 与 dataflow 两个插件)为例,详细记录从项目内工作流到 marketplace 分发的完整实践:分类、插件化设计、hook 注入、版本管理、评估驱动迭代与踩坑。
SDD 的约束模型存在结构性缺陷:spec 是静态文档,约束依赖 Agent 主动阅读并自行对照,执行阶段仍会出现遗漏。本文介绍 DataFlow-CV 从 SDD 到 Skills 的优化实践:spec 维护方法论固化、开发 skill 抽取与 CLAUDE.md 结构优化、PreToolUse hook 主动约束注入,以及插件化分发与工程解耦。
大模型并不直接「读」文本,也不直接「看」图片——所有输入都要先被翻译成模型唯一认识的数学对象:Token(词元)。本文讲清楚文本和图片如何一步步变成 Token 序列:文本走 Tokenizer 与 Embedding 查表,图片走 ViT 切块、投影与拼接。
系列第三篇,聚焦多模型编排:复杂任务单个 prompt 装不下,需要拆成多个 prompt、甚至多个模型协同。介绍3种编排模式(Prompt Chaining、路由策略、Tool-use / Agent 协作)各自适用的场景和 prompt 设计要点。
系列第二篇,聚焦 RAG:把外部知识检索出来注入 prompt,补 LLM 的知识盲区;但注入方式不对,模型照样会忽略检索结果、自行编造。介绍 System Prompt 约束、上下文格式和引用设计的完整写法,可直接套用。
系列第一篇,聚焦单 prompt:同样的任务,prompt 写得好坏,模型输出质量可以差出数量级。介绍4个优化技巧(需求明确化、思维链 CoT、Few-shot 示例、结构化输出),每个都配有可复用的 prompt 模板。
Claude Code + DeepSeek V4.0 … YYDS !!!
从 Vibe Coding 到 SDD:上下文天花板、熵增陷阱、被动重写——三个痛点指向同一个问题:缺少可复用的、模型能直接消费的「真理来源」。本文记录 DataFlow-CV 的 SDD 落地实践:三层 spec 体系、五步开发工作流、两个典型案例,以及下一步从 SDD 到 Rules/Skills 的升级路径。