diff --git a/microsoft-Phi-3-mini-128k-instruct/QNN/config.json b/microsoft-Phi-3-mini-128k-instruct/QNN/config.json index 67dede031..8a754eb31 100644 --- a/microsoft-Phi-3-mini-128k-instruct/QNN/config.json +++ b/microsoft-Phi-3-mini-128k-instruct/QNN/config.json @@ -60,7 +60,7 @@ "gs": { "type": "GraphSurgeries", "surgeries": [ - { "surgeon": "RemoveRopeMultiCache" }, + { "surgeon": "RemoveRopeMultiCache", "use_large_cache": true }, { "surgeon": "AttentionMaskToSequenceLengths" }, { "surgeon": "SimplifiedLayerNormToL2Norm" } ], diff --git a/microsoft-Phi-3.5-mini-instruct/QNN/x2_elite_config.json b/microsoft-Phi-3.5-mini-instruct/QNN/x2_elite_config.json index 0985fa9da..de0b76c78 100644 --- a/microsoft-Phi-3.5-mini-instruct/QNN/x2_elite_config.json +++ b/microsoft-Phi-3.5-mini-instruct/QNN/x2_elite_config.json @@ -64,7 +64,7 @@ "gs": { "type": "GraphSurgeries", "surgeries": [ - { "surgeon": "RemoveRopeMultiCache" }, + { "surgeon": "RemoveRopeMultiCache", "use_large_cache": true }, { "surgeon": "AttentionMaskToSequenceLengths" }, { "surgeon": "RemoveGidxFromMatMulNBits" }, { "surgeon": "SimplifiedLayerNormToL2Norm" } diff --git a/microsoft-Phi-3.5-mini-instruct/QNN/x_elite_config.json b/microsoft-Phi-3.5-mini-instruct/QNN/x_elite_config.json index a09cad46d..d4109b8fb 100644 --- a/microsoft-Phi-3.5-mini-instruct/QNN/x_elite_config.json +++ b/microsoft-Phi-3.5-mini-instruct/QNN/x_elite_config.json @@ -64,7 +64,7 @@ "gs": { "type": "GraphSurgeries", "surgeries": [ - { "surgeon": "RemoveRopeMultiCache" }, + { "surgeon": "RemoveRopeMultiCache", "use_large_cache": true}, { "surgeon": "AttentionMaskToSequenceLengths" }, { "surgeon": "RemoveGidxFromMatMulNBits" }, { "surgeon": "SimplifiedLayerNormToL2Norm" }