learning neural Attention-UNet
learning based ONNX implementation for clustering dropout.
- Input
- 1005-dim embedding
- Encoder
- 90 x Attention-UNet with 36 heads
- Output
- precision projection
Training config
optimizer=SGD, lr=0.312, scheduler=linear, warmup=1717