Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
1 change: 1 addition & 0 deletions packages/ai/scripts/generate-models.ts
Original file line number Diff line number Diff line change
Expand Up @@ -146,6 +146,7 @@ const PRIME_INFERENCE_MODEL_METADATA: Record<string, PrimeInferenceModelMetadata
"openai/gpt-5.5": { contextWindow: 1050000, maxTokens: 128000, vision: true },
"prime-intellect/intellect-3": { contextWindow: 131072, maxTokens: 131072 },
"qwen/qwen3-235b-a22b-thinking-2507": { contextWindow: 262144, maxTokens: 4096 },
"qwen/qwen3-30b-a3b-instruct-2507": { contextWindow: 262144, maxTokens: 65536 },
"qwen/qwen3-coder-next": { contextWindow: 262144, maxTokens: 65536 },
"qwen/qwen3-max": { contextWindow: 262144, maxTokens: 65536 },
"qwen/qwen3-vl-235b-a22b-thinking": { contextWindow: 262144, maxTokens: 32768, vision: true },
Expand Down
18 changes: 18 additions & 0 deletions packages/ai/src/models.generated.ts
Original file line number Diff line number Diff line change
Expand Up @@ -13169,6 +13169,24 @@ export const MODELS = {
contextWindow: 131072,
maxTokens: 131072,
} satisfies Model<"openai-completions">,
"qwen/qwen3-30b-a3b-instruct-2507": {
id: "qwen/qwen3-30b-a3b-instruct-2507",
name: "QWEN3 30B A3B Instruct 2507",
api: "openai-completions",
provider: "prime-inference",
baseUrl: "https://api.pinference.ai/api/v1",
compat: {"supportsStore":false,"supportsDeveloperRole":false,"supportsReasoningEffort":true,"maxTokensField":"max_tokens","supportsStrictMode":false},
reasoning: false,
input: ["text"],
cost: {
input: 0.2,
output: 0.8,
cacheRead: 0,
cacheWrite: 0,
},
contextWindow: 262144,
maxTokens: 65536,
} satisfies Model<"openai-completions">,
"qwen/qwen3-coder-next": {
id: "qwen/qwen3-coder-next",
name: "QWEN3 Coder Next",
Expand Down
Original file line number Diff line number Diff line change
Expand Up @@ -9,9 +9,8 @@ const SWEEP_INTERVAL_MS = 25_000;
// Collapse a tool-use loop's rapid turn_end bursts into one summarization.
const SETTLE_DEBOUNCE_MS = 2_000;

// Small self-hosted open-weight model, off the proxied frontier models.
const SUMMARY_MODEL_PROVIDER = "prime-inference";
const SUMMARY_MODEL_ID = "nvidia/nemotron-3-nano-30b-a3b";
const SUMMARY_MODEL_ID = "qwen/qwen3-30b-a3b-instruct-2507";

const SUMMARY_CONTEXT_MESSAGES = 8;
const SUMMARY_MAX_CHARS_PER_MESSAGE = 600;
Expand Down
Loading