2026年9月25日Aleksandar Stajić概览, 数据边界, 反模式, 评估与质量门槛, 用例组合, 成本与延迟控制什么是RAG?对其工作原理的最简单解释RAG听起来很复杂,但想法很简单:在AI回答之前,它先从知识源查找有用的信息,并将该信息提供给语言模型。本指南使用一个简单的思维模型来解释RAG、LLM、状态、记忆和工具。阅读更多 已发布
2026年9月25日Aleksandar Stajić评估与质量门槛, 在测试集上验证, 验证与对比计算机使用代理:为什么成功的演示仍可能是一个不可靠的系统计算机使用代理如今能够完成令人印象深刻的浏览器和桌面工作流程,但一次成功的运行证明的是能力——而非可靠性。本文展示了如何测试可重复性、环境鲁棒性、长时程控制、状态感知、结果验证以及安全的目标处理。阅读更多 已发布
2026年9月25日Aleksandar Stajić数据边界, 策略与数据边界, 概览MCP vs A2A vs UCP vs AP2 vs A2UI:智能体协议栈详解MCP、A2A、UCP、AP2 和 A2UI 常被描述为相互竞争的智能体标准。它们大多解决的是不同的互操作性问题。本指南将每个协议映射到其实际标准化的边界,并展示它们如何在同一个生产系统中协同工作。阅读更多 已发布
2026年9月25日Aleksandar Stajić评估框架, 优化闭环, 监控(质量/漂移)托管代理框架与自托管代理循环:你得到什么,失去什么“自托管代理”可能意味着截然不同的架构。本指南区分了托管式运行框架、自托管执行环境和完全自主运营的代理循环——并说明了团队实际需要哪种控制边界。阅读更多 已发布
2026年9月25日Aleksandar Stajić阶段(计划→执行→验证), 验证与对比, 风险登记册从OpenAI Agents SDK迁移到Agents API:架构上究竟有哪些变化?从 OpenAI Agents SDK 迁移到新的 Agents API 并不是简单的导入重命名。运行时边界发生了变化:代理循环、持久会话、编排、上下文压缩与恢复都向托管执行框架迁移。本指南说明哪些应当迁移、哪些应当保留在您的应用程序中,以及如何在切换前验证迁移。阅读更多 已发布
2026年9月25日Aleksandar StajićOverview, 能力, 概览OpenAI Agents API 与 Agents SDK 与 Responses API:2026 年你应该基于什么来构建?OpenAI 的智能体技术栈在 2026 年 9 月发生了变化。本架构指南按运行时归属将 Agents API、Agents SDK、Responses API 和 Codex SDK 区分开来——以便团队能够选择正确的控制边界,而不是比较产品名称。阅读更多 已发布
2026年9月25日Aleksandar Stajić信息架构, 成本与延迟控制, 在测试集上验证为什么更多上下文会让AI的回答更糟更大的上下文窗口并不保证更好的答案。本文解释了信号稀释、证据冲突、状态过时、位置敏感性和有损压缩如何降低AI可靠性——并介绍了一种实用的上下文压力测试。阅读更多 已发布
2026年9月25日Aleksandar Stajić策略与数据边界, 在测试集上验证, 内容运营如何判断一个AI智能体是否真正使用了正确的证据AI代理可以引用来源,却仍然使用错误的证据。本文介绍一种实用方法,用于核查主张支持、来源权威性、适用性、出处,以及证据是否实际影响了答案。阅读更多 已发布
2026年9月25日Aleksandar Stajić信息架构, 数据边界, 质量门槛AI代理记忆不是RAG:如何区分记忆、检索、状态和上下文代理记忆、RAG、状态和上下文经常被当作可以互换的概念来使用。它们并不是。这个实用的架构模型将这四个层次区分开来,展示了每一层各自应处的位置,并解释了当系统将它们合并为一层时会出现什么问题。阅读更多 已发布
2026年9月25日Aleksandar Stajić数据边界, 策略与数据边界, 威胁模型AI代理应该记住、遗忘、重新计算还是再次检索什么?长时间运行的代理不应记住所有内容。本文提供了一个实用的生命周期模型,用于决定哪些内容应属于持久记忆、哪些内容应重新检索、哪些内容重新计算更安全,以及哪些内容应过期或被取代。阅读更多 已发布
2026年9月24日Aleksandar Stajić评估与质量门槛, 评估框架, 质量门槛RAG失败了——但究竟是哪一层真正失败了?一种诊断方法当RAG答案出错时,将问题归咎于检索或模型过于笼统。这种诊断方法将来源覆盖、查询构建、检索、排序、上下文组装、生成、证据归因和时效性逐一隔离,从而使实际故障能够被复现并修复。阅读更多 已发布
2026年9月24日Aleksandar Stajić策略与数据边界, 数据边界, 信息架构答案有效性边界:相关性到可靠AI答案之间缺失的层级一个来源可能相关、权威,但对于所提出的问题仍然是错误的。缺失的层次是适用性:答案成立的条件,以及迫使其被重新考虑的变化。本文介绍了“答案有效性边界”这一面向人类、AI搜索和RAG系统的来源设计模式。阅读更多 已发布
2026年9月23日Aleksandar StajićLLM能力参考模型, 数据边界, 成本与延迟控制GPU 不是产品:面向未来的私有 AI 架构私有 AI 基础设施不应围绕单一 GPU 或单一模型来设计。更具韧性的做法是将快速推理 GPU、内存充裕的 AI 系统、物理 AI 节点以及可选的前沿云模型,统一置于一个具备能力感知的路由层之后。阅读更多 已发布
2026年9月19日Aleksandar Stajić从研究协议到通用AI推理框架为严谨的AI辅助研究而开发的一套方法论,其可推广范围远超研究本身。通过将证据与假设分离、检验相互竞争的假设、控制提示框架、搜寻反证并应用领域特定的验证器,同一推理架构可以改进调试、软件设计、战略、技术分析以及AI辅助决策支持。阅读更多 已发布
2026年9月19日Aleksandar Stajić人工智能推理的可证伪性:从答案到经过检验的假设AI模型几乎可以为任何看似合理的假设生成令人信服的证据。一种更可靠的方法论则提出相反的问题:什么证据会削弱、反驳或迫使我们放弃该结论?本文利用竞争性假设、判别性检验、反证和明确的拒绝标准,为LLM发展以证伪为导向的推理。阅读更多 已发布
2026年9月19日Aleksandar Stajić提示不变性:结论在提示变化后是否依然成立?一种用于检验AI结论是否依赖于问题表述方式的实用方法。提示不变性比较原始、盲测、反向和对抗性表述,同时保持证据结构受控。阅读更多 已发布
2026年9月19日Aleksandar Stajić提示词本身就是偏见的一部分:AI的框架设定如何塑造推理提示词的措辞并非中立。探索框架设定、预设假设、指令遵循和谄媚如何塑造AI推理——以及为什么可靠的结论需要在原始提示之外进行测试。阅读更多 已发布
2026年9月19日Aleksandar Stajić超越提示工程:一种更可靠的人工智能推理方法大型语言模型未必是因为缺乏推理能力而失败。它们常常失败,是因为推理过程没有得到充分的约束、质疑或验证。本文提出一种与领域无关的方法论,将提示转化为一种结构化的认知过程:将事实与假设分离,生成相互竞争的假说,检验反证,应用证伪,并检查结论在替代性框架下是否仍然稳定。目标不是让模型“更少同意”,而是让它的结论更少依赖于用户最初的框架。阅读更多 已发布
2026年9月9日Aleksandar Stajić评估与质量门槛, 治理与可审计性AI Agent可靠性:为什么最终答案并不足够正确的输出并不能证明推理的正确性、执行的安全性,或系统的可信赖性。阅读更多 已发布
2026年9月6日Aleksandar Stajić验收标准, KPI与验收标准企业剧本中采用大语言模型的验收标准终极指南掌握定义精确验收标准的艺术,确保大型语言模型在企业环境中成功集成。本全面指南提供可操作的框架、实例及最佳实践,专为剧本驱动式应用量身定制。阅读更多 已发布
2026年6月28日Aleksandar Stajić企业交付操作系统, LLMOps作战手册, 评估与质量门槛, 评估框架, 质量门槛Ollama 并非产品:构建可投入生产的开源大语言模型应用使用Ollama运行本地模型很简单。但构建一个可用于生产环境的开源大语言模型(Open-LLM)应用则更具挑战性:它需要RAG(检索增强生成)、访问控制、供应商抽象、评估、日志记录、部署规范,以及围绕模型构建受控的应用层。阅读更多 已发布
2026年6月16日Aleksandar StajićRouter, Network, Hardware, 备份与恢复下一代OpenWrt 5G路由器:为何Wi-Fi 7、更强CPU与更优固件至关重要ZBT Z8102AX 是一个有用的初步样品,但下一步应该更强:Wi-Fi 7、更强大的四核平台、更清晰的固件、改进的包装以及更稳定的定价策略。目标不仅仅是另一款5G路由器,而是一款配置更优、基于OpenWrt的准专业级设备。阅读更多 已发布
2026年6月16日Aleksandar StajićRouter, Network, Hardware, 验证与对比, 在测试集上验证你应该购买带有旧固件的5G OpenWrt路由器吗?以ZBT Z8102AX为例购买搭载旧版固件的5G OpenWrt路由器在特定条件下是合理的。ZBT Z8102AX型号清晰展现了利弊两面:硬件实用、调制解调器工作正常,测试中路由器保持稳定,但OpenWrt 21.02版本、简陋的包装以及不明确的升级路径,要求消费者在购买时需审慎决策。阅读更多 已发布
2026年6月16日Aleksandar StajićRouter, Network, Hardware, 测量与监控, 监控(质量/漂移)ZBT Z8102AX 双SIM卡故障切换:有效功能、缺失功能及固件需改进之处ZBT Z8102AX是一款双SIM卡5G OpenWrt路由器,但仅具备双SIM卡硬件并不等同于智能故障切换。该路由器能识别SIM卡并成功连接,但自动切换、调制解调器恢复、基于信号的决策以及清晰的故障切换逻辑仍需更深入的测试。阅读更多 已发布