文章
全部内容 · 共 10 篇 · 最新在前
评测与基准
RAG 系统评估——指标、数据集与落地方法
RAG 系统的评估方法。提出分层指标体系,说明黄金 QA 集的构建要点与评估方法,归纳常见失败模式与诊断流程,可供搭建可复跑的评测流程。
浏览 15 次
2026-09-22 →
模型家族与选型
GPT-5 架构拆解——稀疏注意力、MoE 与记忆管理
GPT-5 架构的公开信息梳理与推断。基于官方口径与逆向分析,讨论稀疏 MoE、动态注意力、显式思维三方面推断,说明其对应用适配的工程影响。
浏览 13 次
2026-09-22 →
对齐技术
LLM 对齐技术——RLHF、DPO 与 Constitutional AI 对比
主流 LLM 对齐技术的对比与选型。梳理 RLHF、DPO、Constitutional AI 三条路线,从七个维度对比特性,给出场景决策表与调优陷阱。
浏览 13 次
2026-09-22 →
模型侧推理改造
大模型推理优化——KV 缓存与量化的取舍
大模型推理阶段的显存与成本优化。以 27B 模型在 A100 80GB 上的部署为例,对比 KV 缓存与量化两条路线的取舍与精度代价,并给出部署组合建议。
浏览 15 次
2026-09-22 →
模型能力与范式
长上下文技术——位置编码、记忆压缩与成本
长上下文技术的成本结构。围绕位置编码与记忆压缩,结合 27B 模型实测,分析上下文由 4K 扩展至 1M 时的性能与成本变化,供预算与选型参考。
浏览 13 次
2026-09-22 →
模型能力与范式
Qwen-Image-2.1 的开源图像生成能力 透明图层、编辑与本地门槛
Qwen-Image-2.1(2026-09-20 发布)的能力评测、与闭源对比的领先幅度、本地显存门槛与 Qwen 许可证对商用的限制。
浏览 52 次
2026-09-21 →
模型能力与范式
GPT-6 Astra 的计算机操控能力 基准、定价与上线节奏
GPT-6 Astra(2026-09-03 发布)的自主计算机操控能力、基准表现(含注脚)、定价对比、分阶段上线计划与适用场景边界。
浏览 27 次
2026-09-21 →
模型家族与选型
Qwen3.8 规格对比与选型 — 27B / 2.4T-A95B / Max
Qwen3.8 三档模型(27B/2.4T/Max)怎么分、参数差在哪、各自适合什么场景,附官方入口。
浏览 47 次
2026-09-21 →
大模型专题
开源大模型榜单与下载指引(2026年第38周)
基于 Artificial Analysis 第38周实测数据:开源模型总榜、国产/国外对照、下载渠道与部署指引。
浏览 41 次
2026-09-21 →