Skip to content

Commit a48f25b

Browse files
authored
Merge pull request #47 from xu16601526267/fix/musa-qwen-defaults
catalog(models): default AIBook Qwen variants to vllm-musa
2 parents 1d35c31 + 1e6e60a commit a48f25b

3 files changed

Lines changed: 75 additions & 5 deletions

File tree

catalog/models/qwen3-8b.yaml

Lines changed: 3 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -8,6 +8,7 @@ metadata:
88
aliases:
99
- Qwen3-8B-junhowie
1010
- gptq-Qwen3-8B-junhowie
11+
- gptq-Qwen3-8B
1112
storage:
1213
formats: [safetensors, gguf]
1314
default_path_pattern: "{{.DataDir}}/models/{{.Name}}"
@@ -96,7 +97,7 @@ variants:
9697
format: safetensors
9798
default_config:
9899
gpu_memory_utilization: 0.70
99-
max_model_len: 16384
100+
max_model_len: 8192
100101
max_num_seqs: 1
101102
enforce_eager: true
102103
dtype: auto
@@ -114,7 +115,7 @@ variants:
114115
gpu_arch: MUSA
115116
vram_min_mib: 6144
116117
unified_memory: true
117-
engine: vllm
118+
engine: vllm-musa
118119
format: safetensors
119120
default_config:
120121
gpu_memory_utilization: 0.50

catalog/models/qwen3-emb-0.6b.yaml

Lines changed: 2 additions & 2 deletions
Original file line numberDiff line numberDiff line change
@@ -31,7 +31,7 @@ variants:
3131
gpu_arch: MUSA
3232
vram_min_mib: 4096
3333
unified_memory: true
34-
engine: vllm
34+
engine: vllm-musa
3535
format: safetensors
3636
default_config:
3737
gpu_memory_utilization: 0.20
@@ -54,7 +54,7 @@ variants:
5454
gpu_arch: MUSA
5555
vram_min_mib: 4096
5656
unified_memory: true
57-
engine: vllm
57+
engine: vllm-musa
5858
format: safetensors
5959
default_config:
6060
gpu_memory_utilization: 0.10

internal/knowledge/resolver_test.go

Lines changed: 70 additions & 1 deletion
Original file line numberDiff line numberDiff line change
@@ -463,7 +463,7 @@ func TestResolveCatalogModelName(t *testing.T) {
463463
}},
464464
{Metadata: ModelMetadata{
465465
Name: "qwen3-8b",
466-
Aliases: []string{"Qwen3-8B-junhowie", "gptq-Qwen3-8B-junhowie"},
466+
Aliases: []string{"Qwen3-8B-junhowie", "gptq-Qwen3-8B-junhowie", "gptq-Qwen3-8B"},
467467
}},
468468
{Metadata: ModelMetadata{Name: "llama-3.1-8b"}},
469469
},
@@ -477,6 +477,7 @@ func TestResolveCatalogModelName(t *testing.T) {
477477
{"alias exact case", "Qwen3-Embedding-0.6B", "qwen3-emb-0.6b"},
478478
{"alias lowercase", "qwen3-embedding-0.6b", "qwen3-emb-0.6b"},
479479
{"quant-prefixed alias", "gptq-Qwen3-8B-junhowie", "qwen3-8b"},
480+
{"quant short alias", "gptq-Qwen3-8B", "qwen3-8b"},
480481
{"canonical name passthrough", "qwen3-8b", "qwen3-8b"},
481482
{"canonical name different case", "LLaMA-3.1-8B", "llama-3.1-8b"},
482483
{"no match returns input", "some-unknown-model", "some-unknown-model"},
@@ -1547,6 +1548,74 @@ func TestResolveLeavesEngineImageEmptyForNativePreinstalledEngine(t *testing.T)
15471548
if resolved.RuntimeRecommendation != "native" {
15481549
t.Fatalf("RuntimeRecommendation = %q, want native", resolved.RuntimeRecommendation)
15491550
}
1551+
if resolved.Engine != "vllm" {
1552+
t.Fatalf("Engine = %q, want vllm", resolved.Engine)
1553+
}
1554+
if resolved.EngineAssetName != "vllm-musa" {
1555+
t.Fatalf("EngineAssetName = %q, want vllm-musa", resolved.EngineAssetName)
1556+
}
1557+
}
1558+
1559+
func TestResolveKeepsBlackwellVariantOnVLLM(t *testing.T) {
1560+
unified := true
1561+
cat := &Catalog{
1562+
EngineAssets: []EngineAsset{
1563+
{
1564+
Metadata: EngineMetadata{Name: "vllm-blackwell", Type: "vllm", Version: "0.9.2"},
1565+
Hardware: EngineHardware{GPUArch: "Blackwell"},
1566+
Image: EngineImage{Name: "vllm/vllm-openai", Tag: "0.9.2"},
1567+
Startup: EngineStartup{Command: []string{"vllm", "serve"}, DefaultArgs: map[string]any{}, HealthCheck: HealthCheck{Path: "/health", TimeoutS: 60}},
1568+
},
1569+
{
1570+
Metadata: EngineMetadata{Name: "vllm-musa", Type: "vllm", Version: "0.9.2"},
1571+
Hardware: EngineHardware{GPUArch: "MUSA"},
1572+
Source: &EngineSource{
1573+
InstallType: "preinstalled",
1574+
Probe: &EngineSourceProbe{
1575+
Paths: []string{"/opt/mt-ai/llm/venv/bin/vllm"},
1576+
},
1577+
},
1578+
Runtime: EngineRuntime{Default: "native"},
1579+
Startup: EngineStartup{Command: []string{"vllm", "serve"}, DefaultArgs: map[string]any{}, HealthCheck: HealthCheck{Path: "/health", TimeoutS: 60}},
1580+
},
1581+
},
1582+
ModelAssets: []ModelAsset{{
1583+
Kind: "model_asset",
1584+
Metadata: ModelMetadata{Name: "qwen3-8b"},
1585+
Variants: []ModelVariant{
1586+
{
1587+
Name: "qwen3-8b-blackwell-vllm-bf16",
1588+
Engine: "vllm",
1589+
Format: "safetensors",
1590+
Hardware: ModelVariantHardware{
1591+
GPUArch: "Blackwell",
1592+
UnifiedMemory: &unified,
1593+
},
1594+
},
1595+
{
1596+
Name: "qwen3-8b-musa-soc-vllm-gptq",
1597+
Engine: "vllm-musa",
1598+
Format: "safetensors",
1599+
Hardware: ModelVariantHardware{
1600+
GPUArch: "MUSA",
1601+
UnifiedMemory: &unified,
1602+
},
1603+
},
1604+
},
1605+
}},
1606+
}
1607+
1608+
hw := HardwareInfo{GPUArch: "Blackwell", UnifiedMemory: true, Platform: "linux/arm64"}
1609+
resolved, err := cat.Resolve(hw, "qwen3-8b", "vllm", nil)
1610+
if err != nil {
1611+
t.Fatalf("Resolve: %v", err)
1612+
}
1613+
if resolved.Engine != "vllm" {
1614+
t.Fatalf("Engine = %q, want vllm", resolved.Engine)
1615+
}
1616+
if resolved.EngineAssetName != "vllm-blackwell" {
1617+
t.Fatalf("EngineAssetName = %q, want vllm-blackwell", resolved.EngineAssetName)
1618+
}
15501619
}
15511620

15521621
func TestCheckFitPowerBudget(t *testing.T) {

0 commit comments

Comments
 (0)