Real-Time Control Simulation

Level 3
ε = 0.10
Ready
0 / 1000 steps
0
Cumulative Reward
--
Settling Time (s)
--
Steady-State Error (°)
0
Fuel Used (g)
--
Overshoot (%)

Training Process Visualization

PPO Algorithm

for iteration = 1, 2, ... do:
    Collect trajectories using policy π_θ
    Compute advantages A_t using GAE(λ)

    for epoch = 1, ..., K do:
        for minibatch in trajectories do:
            Compute ratio r_t(θ) = π_θ(a|s) / π_θ_old(a|s)
            L_CLIP = min(r_t A_t, clip(r_t, 1-ε, 1+ε) A_t)
            Update θ by maximizing L_CLIP - c₁ L_VF + c₂ S[π_θ]
                    
1e-4
λ = 0.95
ε = 0.20
0
Episodes
--
Avg Reward
--
Policy Loss
--
Value Loss

Policy Network Analysis

Actor Network

• Input: 12D state (attitude quaternion, angular rates, target)
• Hidden: 256-256-128 neurons (ReLU)
• Output: 3D mean + 3D log_std
• Total Parameters: 127,747

Critic Network

• Input: 12D state
• Hidden: 256-256-128 neurons (ReLU)
• Output: 1D value estimate
• Total Parameters: 98,049

Reward Shaping

• R = -|e|² - 0.1|ω|² - 0.01|τ|² + bonus
• Pointing error penalized quadratically
• Rate damping for stability
• Control effort minimization

Algorithm & Baseline Comparison

PPO Strengths

• Stable training with clipped objective
• Good sample efficiency for on-policy
• Handles continuous action spaces well
• Robust to hyperparameter choices

SAC Strengths

• Maximum entropy for exploration
• Excellent sample efficiency
• Robust final policies
• Automatic temperature tuning

Classical Control

• Guaranteed stability margins
• Well-understood behavior
• Lower computational cost
• Easier certification