碎片集

今天 · 7 月 25 日 周六

想法

一、朱雀到底在检测什么

绝大多数人以为朱雀在查"这段话是否抄袭了 AI 的回答"——不是。朱雀检测的是文本的统计指纹

检测维度 含义 AI 文本的特征
困惑度 文本有多可预测。给定前几个词后,下一个词有多大概率被猜到 倾向选高概率词,困惑度极低
爆发性 句子长度和结构的变化幅度 句子长度均匀,结构规整
语义连贯性 段落间过渡有多丝滑 过度丝滑,教科书级逻辑链
词汇分布 高频词、低频词的出现模式 部分 AI 模型有专属高频词指纹

一句话:并非抓"AI 写了什么",而是抓"写得有多像 AI"。

这意味着:

  • 换同义词没用。朱雀不看词,看概率分布。
  • 增加"活人感"口癖没用——如果口癖的投放位置和频率是规律化的。
  • 规则越多越像 AI 。 如果你给文本制定了严格的改写规则,文本的统计分布会反过来变得更可预测。
AI 对话

问: 建设一个网站,初步 PC+H5 即可,然后做成 skill 技能,技术上要极简,支持 .md 格式的直接上传,每次跟 AI 智能体沟通完,调用技能即可自动上传到服务器,方便汇总浏览,合适的时候再做成 app 以及小程序,可以在手机中随时记录自己的想法碎片,然后发网址给 workbuddy 聊天时,可以实时调用全站历史信息,来支撑我的个性化要求。你会使用什么程序栈?目前服务器用的宝塔面板,部署要极简。

答: 推荐程序栈: PHP 8.x + SQLite + 原生前端(极简三件套)——宝塔原生支持零环境安装、 SQLite 单文件数据库备份即复制、与现有创业者引擎同栈维护心智一致。产品定位"个人知识碎片沉淀站":内容为 AI 对话记录与想法碎片,两个核心集成——WorkBuddy skill 一键上传对话、全文搜索 API 供 AI 聊天时实时检索全站。随后一轮确认四个关键决策:使用范围=公开+个人混合(公开部分当作品集,写入仅自己);检索深度=先关键词( FTS5 )架构预留 RAG 升级位;技术栈=PHP+SQLite ;内容形态=md+图片附件。

问: (三文档确认后)继续。

答: 专家团按六阶段流程完成建设并交付。 Phase 1 调研: PM 定位"为 AI 工作流而生的个人内容底座",差异化=AI 原生双通道+数据绝对自有+公开私密一体,竞品差评验证为真实市场空白;架构师攻克最关键技术难题 SQLite FTS5 中文全文搜索——trigram 分词主选( SQLite 3.34+ 内置零部署摩擦), 1-2 字符查询走 LIKE 降级路由( trigram 对 3 字符以下查询静默返空是已知坑);设计师定调 Linear 式冷峻骨架+钢青墨 #0E7490 主色(刻意避开 indigo 模板味)+Lucide 图标库+浅色单主题全 Token 化。 Phase 1.5 冻结 Spec ( 13 章节、 21 条 EARS 验收标准、 10 条内嵌坑)。 Phase 2-3 产出 openapi.yaml ( 9 端点契约)+schema.sql ( 6 表)+前后端实现( PHP 零框架分层+SSR 服务端渲染)。 Phase 4 :独立 QA 测试 181/181 全绿(抓出并修复 pangu 中英文混排全站静默失效、 PHP ini 与上传契约错位两项 P1 ),千条压测搜索 20ms ( 15 倍预算余量),安全攻击面( XSS/SQLi/爆破/限流/越权)全部实测防住;运维产出部署四件套( 0.31MB zip+nginx 配置+每日备份脚本+宝塔手册),解压冒烟 53/53 实证通过。同步交付 note-archiver skill ,实现"归档对话+检索全站"双能力闭环。

问: 归档这次对话。

答: 执行 note-archiver 首次真实归档。站点 my.shizhan.vip 探针全绿: PHP 8.2.28 (锚定版本)+ SQLite 3.46.1 + FTS5 trigram 全功能模式(无降级)+ data 可写。本篇即站点建成后的第一条 ai_conversation 归档。