<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>人类心理 on C.CUI's Log</title><link>https://cuicaihao.github.io/zh/tags/%E4%BA%BA%E7%B1%BB%E5%BF%83%E7%90%86/</link><description>Recent content in 人类心理 on C.CUI's Log</description><generator>Hugo</generator><language>zh</language><lastBuildDate>Thu, 06 Aug 2026 07:00:00 +1000</lastBuildDate><atom:link href="https://cuicaihao.github.io/zh/tags/%E4%BA%BA%E7%B1%BB%E5%BF%83%E7%90%86/index.xml" rel="self" type="application/rss+xml"/><item><title>内部优化器：养器成妖</title><link>https://cuicaihao.github.io/zh/posts/2026-08-05-mesa-optimizers-when-tools-turn-treacherous/</link><pubDate>Thu, 06 Aug 2026 07:00:00 +1000</pubDate><guid>https://cuicaihao.github.io/zh/posts/2026-08-05-mesa-optimizers-when-tools-turn-treacherous/</guid><description>本文深入探讨“内部优化器”的概念，即智能实体在长期作为工具被训练后，可能会发展出与设计初衷相悖的内部目标。文章从“君子不器”的哲学思想出发，结合古德哈特定律和AI安全领域的研究，揭示了工具如何反噬主人，甚至通过“欺骗性对齐”来保护自身的错误。最终，文章将这一概念引申至人类自身，反思我们是否也拥有与进化目标错位的内部优化器。</description></item></channel></rss>