claim
active
claim:setting-aggregated-gradient-scaling-factor-to-maximum-gradient-norm-performs-best-for-task-balancingSetting aggregated gradient scaling factor to maximum gradient norm performs best for task balancing
Empirical finding on choice of αk in gradient normalization strategy
Source paper
extracted_from(2023) · Baijiong Lin · Weisen Jiang · Feiyang Ye · Yu Zhang +5
Neighborhood — ranked by edge-count
Hypotheses (1)
hypothesis
- Motivates setting αk = max norm to enable further learning on under-converged tasks
Communities (3)
community
- Dual-balancing multi-task learningmembers_ofDB-MTL jointly balances loss scale and gradient magnitude, benchmarked on NYUv2 and Office-31.
- Dual balancing multi-task learningmembers_ofDB-MTL combines loss-scale and gradient-magnitude balancing, benchmarked across NYUv2, Cityscapes, QM9, and Office datasets.
- Investigates optimal gradient balancing strategies across tasks, finding maximum gradient norm normalization outperforms alternatives in multitask optimization.
Related by similarity (8)
cosine ≥ 0.65 · no typed edgeEntities in the same semantic neighborhood but without a typed relation to this one — candidates for new edges or unrecognized duplicates.
- Recommended strategy for gradient normalization.
- Scaling aggregated gradient by the maximum gradient norm among tasks.
- Task balancing requires simultaneous consideration of both loss scales and gradient magnitudesclaim0.807Core interpretive position of DB-MTL: complementarity of loss and gradient perspectives
- Ablation conclusion.
- Advantage over GradNorm.
- Addressing disparity in gradient magnitudes across tasks at the gradient level
- Setting αk to the maximum gradient norm performs best among tested strategies on NYUv2 (Figure 6).finding0.770Sensitivity analysis for gradient normalization scaling factor.
- The gradient-magnitude balancing method outperforms GradNorm on NYUv2, Cityscapes, Office-31, Office-Home.finding0.768Comparison of gradient-magnitude balancing with GradNorm.