跳到內容

信念迴圈(Belief Loop)

給 agent 一套像人一樣的對外部世界信念循環:先講出預測,讓現實打分, 下一次決策時看見自己的校準紀錄。

Task forward model(v1.53/v1.54)預測的對象是 agent 自身的執行 (會用哪些工具、呼叫幾次、判官會不會放行)。信念迴圈補上先前缺少的外層: 對外部世界的結構化預測,主題不限,市場只是其中之一,一律以觀測到的 現實做決定性結算,並把 agent 的校準紀錄注回它的下一個決策提示詞。

迴圈全貌(所有掛鉤都是程式化的:平台計算每一筆信念與現實的差異並負責注入, 從未要求 agent 自己回想當初預測了什麼。這個設計受 arXiv:2605.29463 的反思虛構證據所迫,沒有選擇空間):

belief_submit (MCP) ──▶ belief_log (prediction.db)
▲ │
│ 校準區段注入 │ tick 喚醒附上一行對照:
│ 下一輪派工提示詞 │ 「你說 70% 會漲,現在跌 1.2%」
│ (結算未滿 30 筆 ▼
│ 只顯示筆數) belief_settle (MCP) ─▶ 決定性三向 Brier 結算
└────────────────────────┘ (即時觀測交叉核對,容差 ±1%)

Agent 拿到三個 MCP 工具:

  • belief_submit:subject(任何要預測的外部對象,例如股票代號 2317trial_conversion_rate 這類 KPI)、horizon(自由格式的結算時點標籤, 例如 今日收盤本週五,上限 40 字元)、direction(up/down/flat)、 probability(0 到 1)、一句簡短理由,以及方向據以衡量的參考值。
  • belief_settle:信念 id 加上實現值。結算是決定性的:方向對照參考值、 可設定的持平帶([belief] flat_band_pct,預設 0.3%)、三向 Brier 計分。 若 gateway 對該 subject 有即時 tick 觀測,會交叉核對回報的實現值 (容差 1%,偏差過大直接拒絕;agent 無法自行宣稱現實長什麼樣)。 tick 欄位對應到 subject 有兩條路:平台的 zXXXX → XXXX 命名慣例, 或在 config.toml 明寫一筆 [belief] tick_subject_map (鍵是 tick 欄位名、值是 subject),供不符合慣例的來源使用。
  • belief_stats:agent 自己的校準紀錄。

儀表板:Foresight 頁新增「信念與驗證」分頁,內容包含預測清單 (方向與信心對照實現結果、命中與否)、Wilson 下界命中率、平均 Brier、 過度自信程度。已結算信念未滿 30 筆時只顯示筆數並明講原因, 絕不出現「看起來有效」這種說法。

  • 投資(第一個通過驗證的使用場景):subject 是股票代號,horizon 是 今日收盤,參考值是送出當下的價格,實現值是收盤價。若有設定即時 tick 來源,結算時會與其交叉核對。
  • 業務 KPI:subject 是 trial_conversion_rate,horizon 是 本週五, 參考值是本週起始的轉換率。agent 每週一提交一筆對走向的信念, 週末以 CRM 的實際數字結算。這條路完全不需要 tick 來源, 改由排程的 goal 任務驅動結算即可。
  • 把 agent 的校準歷史注入提示詞是一項實驗,尚未被證明有效。 2026-08 的文獻掃描找不到任何一手證據支持或反對,因此每筆信念都記錄 當時是否注入了統計(stats_injected),讓這個問題可以用你自己的資料回答。
  • 校準與任務成果分開計分,兩者已知會分歧(arXiv:2607.03015): 校準良好的 agent 未必是高表現的 agent,儀表板也絕不把兩者混為一談。
  • 已結算樣本未滿 30 筆時,任何數字都不會被當成結論呈現 (全程使用 Wilson 下界與純筆數顯示)。