Expand description
Reinforcement-learning-style feedback collector and reward modeler.
This module records per-request feedback, computes composite reward signals, and maintains a running weighted average reward per (model, prompt_template) pair. The reward weight decays exponentially with time so that recent observations matter more than old ones.
Structsยง
- Feedback
- A single feedback record attached to one request/response pair.
- Feedback
Loop - Closed-loop feedback collector that ties together the store and reward model.
- Feedback
Store - Thread-safe ring buffer of the last
capacityfeedbacks per model variant. - Reward
Model - Running weighted-average reward per
(model, prompt_template)key. - Reward
Signal - Composite reward derived from a single
Feedbackrecord.