<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"><channel><title>Water — 研究</title><description>关于智能系统、工具和时间的长期记录。</description><link>https://sumoer.fun/</link><item><title>关于 Agent 行动边界的几个观察</title><link>https://sumoer.fun/blog/harness/agent-action-boundaries/</link><guid isPermaLink="true">https://sumoer.fun/blog/harness/agent-action-boundaries/</guid><description>当 Agent 从「回答问题」走向「执行任务」，行动的边界就成了设计的核心问题。记录几个来自近期使用与构建的观察。</description><pubDate>Tue, 28 Jul 2026 00:00:00 GMT</pubDate></item><item><title>一个本地优先工具的设计记录</title><link>https://sumoer.fun/blog/harness/local-first-tool-design/</link><guid isPermaLink="true">https://sumoer.fun/blog/harness/local-first-tool-design/</guid><description>记录一个本地优先写作工具的设计过程：为什么本地优先、数据怎么存、同步怎么取舍，以及目前仍未解决的问题。</description><pubDate>Tue, 21 Jul 2026 00:00:00 GMT</pubDate></item><item><title>评估不是打分会</title><link>https://sumoer.fun/blog/eval/evaluation-is-not-scoring/</link><guid isPermaLink="true">https://sumoer.fun/blog/eval/evaluation-is-not-scoring/</guid><description>短观察：给 LLM 输出打分是最容易自欺的评估方式，有效的评估从「什么样的错误不能接受」倒推。</description><pubDate>Wed, 15 Jul 2026 00:00:00 GMT</pubDate></item><item><title>LLM 应用中的状态与记忆</title><link>https://sumoer.fun/blog/llm/llm-state-and-memory/</link><guid isPermaLink="true">https://sumoer.fun/blog/llm/llm-state-and-memory/</guid><description>短观察：大多数 LLM 应用的「记忆」问题其实是状态管理问题，而我们对状态管理的已有经验大多仍然适用。</description><pubDate>Wed, 08 Jul 2026 00:00:00 GMT</pubDate></item><item><title>一次 AIGC 图片筛选流程的实验记录</title><link>https://sumoer.fun/blog/eval/aigc-image-triage/</link><guid isPermaLink="true">https://sumoer.fun/blog/eval/aigc-image-triage/</guid><description>实验：用多模态模型给生成图片做初筛，比较「整体评分」和「分项否决」两种提示词策略的准确率差异。</description><pubDate>Tue, 30 Jun 2026 00:00:00 GMT</pubDate></item></channel></rss>