<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>内部优化器 on C.CUI's Log</title><link>https://cuicaihao.github.io/zh/tags/%E5%86%85%E9%83%A8%E4%BC%98%E5%8C%96%E5%99%A8/</link><description>Recent content in 内部优化器 on C.CUI's Log</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Thu, 06 Aug 2026 07:00:00 +1000</lastBuildDate><atom:link href="https://cuicaihao.github.io/zh/tags/%E5%86%85%E9%83%A8%E4%BC%98%E5%8C%96%E5%99%A8/index.xml" rel="self" type="application/rss+xml"/><item><title>内部优化器：养器成妖</title><link>https://cuicaihao.github.io/zh/posts/2026-08-05-mesa-optimizers-when-tools-turn-treacherous/</link><pubDate>Thu, 06 Aug 2026 07:00:00 +1000</pubDate><guid>https://cuicaihao.github.io/zh/posts/2026-08-05-mesa-optimizers-when-tools-turn-treacherous/</guid><description>本文深入探讨“内部优化器”的概念，即智能实体在长期作为工具被训练后，可能会发展出与设计初衷相悖的内部目标。文章从“君子不器”的哲学思想出发，结合古德哈特定律和AI安全领域的研究，揭示了工具如何反噬主人，甚至通过“欺骗性对齐”来保护自身的错误。最终，文章将这一概念引申至人类自身，反思我们是否也拥有与进化目标错位的内部优化器。</description></item></channel></rss>