+{"adamw_bf16_multi_tensor_elements": 0, "adamw_bf16_multi_tensor_tensors": 0, "adamw_bf16_multi_tensor_threshold": 0, "adamw_implementation": "auto", "adamw_moment_precision": "fp32", "adamw_moment_state_bytes": 4768399360, "adamw_multi_tensor_update": false, "architecture": "gfx942:sramecc+:xnack-", "attention_context_layout_fusion": true, "attention_gemm_scale_fusion": false, "attention_gqa_forward_value_broadcast": false, "attention_gqa_value_broadcast": false, "attention_layout_plan_cache": false, "attention_layout_plan_cache_entries": 0, "attention_layout_plan_cache_hits": 0, "attention_layout_plan_cache_misses": 0, "attention_paired_gqa_repeat": false, "attention_rope_layout_fusion": true, "batch": 1, "bf16_algorithm_registrations": 0, "bf16_algorithm_spec": "", "bf16_training_mirror_bytes": 880803840, "bf16_training_mirror_tensors": 196, "bf16_weight_mirrors_enabled": true, "compute_dtype": "bf16_linear_fp32_master", "context": 32, "device": "hip:0", "device_name": "AMD Instinct MI300X VF", "diagnostics_enabled": false, "engine_allocation_calls": 2254, "engine_backend_allocation_calls": 1280, "engine_backend_deallocation_calls": 0, "engine_cache_reuse_calls": 974, "engine_cached_bytes": 241995148, "engine_current_bytes": 10417602816, "engine_deallocation_calls": 1944, "engine_peak_bytes": 10659004680, "engine_reserved_bytes": 10659597964, "engine_total_allocated_bytes": 2750344844, "final_loss": 2.377071381, "first_loss": 2.377071381, "fp32_gate_up_weight_gradient_solution_index": -1, "fp32_solution_dispatches": 0, "fp32_solution_registered_entries": 0, "fp32_solution_registry_hits": 0, "fp32_solution_registry_misses": 0, "fp32_weight_bytes": 2384199680, "framework": "microllm", "gate_up_parameter_elements": 0, "gate_up_parameter_tensors": 0, "gate_up_parameters_output_written": false, "hip_driver_version": 71399004, "hip_runtime_version": 71399004, "load_current_engine_bytes": 2384199680, "load_device_to_device_calls": 0, "load_device_to_host_calls": 0, "load_host_to_device_bytes": 1192099840, "load_host_to_device_calls": 310, "load_ms": 2323.569196, "load_peak_engine_bytes": 2695364608, "loaded_tensors": 310, "loss": 2.377071381, "loss_trajectory_output_written": false, "loss_trajectory_steps": 1, "mean_optimizer_ms": 6.344704, "mean_step_ms": 7188.488699, "measured_ms": 7188.488699, "measurement_profile": "smoke", "milliseconds_per_token": 224.640271844, "model": "qwen3-0.6b", "observed_parameter_after": 3.937509537, "observed_parameter_before": 3.9375, "optimizer_device_to_host_bytes": 0, "optimizer_device_to_host_calls": 0, "optimizer_host_to_device_bytes": 0, "optimizer_host_to_device_calls": 0, "optimizer_ms": 6.344704, "optimizer_timing_boundary": "post_backward_sync", "pair_order": ["microllm", "pytorch"], "parameter_changed": true, "parameter_count": 596049920, "peak_bytes": 10659004680, "precision": "bf16", "process_run": 1, "record_type": "official_training_shape_measurement", "revision": "c916fa4defd319b7d4e4da17604ca7338f4d99f5", "schema_version": 1, "status": "pass", "step_ms": 7188.488699, "steps": 1, "tied_embedding_sparse_add": true, "tokens_per_second": 4.451561565, "trained_tokens": 32, "unique_gradient_inplace_add": false, "warmup": 0, "warmup_ms": 0.0156}
0 commit comments