Skip to content
Merged
Show file tree
Hide file tree
Changes from all commits
Commits
File filter

Filter by extension

Filter by extension

Conversations
Failed to load comments.
Loading
Jump to
Jump to file
Failed to load files.
Loading
Diff view
Diff view
4 changes: 2 additions & 2 deletions litellm/caching/valkey_semantic_cache.py
Original file line number Diff line number Diff line change
Expand Up @@ -279,7 +279,7 @@ async def async_set_cache(self, key: str, value: Any, **kwargs: Any) -> None:
print_verbose("No prompt provided for semantic caching")
return

embedding = await self._get_async_embedding(prompt, **kwargs)
embedding = await self._get_async_embedding(prompt, metadata=kwargs.get("metadata"))
await self._ensure_index_async(len(embedding))

doc_key = self._doc_key(key)
Expand All @@ -298,7 +298,7 @@ async def async_get_cache(self, key: str, **kwargs: Any) -> Any:
kwargs.setdefault("metadata", {})["semantic-similarity"] = 0.0
return None

embedding = await self._get_async_embedding(prompt, **kwargs)
embedding = await self._get_async_embedding(prompt, metadata=kwargs.get("metadata"))
await self._ensure_index_async(len(embedding))

search_result = await self.async_client.ft(self.index_name).search(
Expand Down
53 changes: 53 additions & 0 deletions tests/test_litellm/caching/test_valkey_semantic_cache.py
Original file line number Diff line number Diff line change
Expand Up @@ -300,6 +300,59 @@ async def test_async_set_and_get_roundtrip():
assert metadata["semantic-similarity"] == pytest.approx(0.95)


@pytest.mark.asyncio
async def test_async_set_cache_passes_only_metadata_to_get_async_embedding():
async_client = AsyncMock()
async_client.ft = _async_ft(0.05)
cache = _make_cache(async_client=async_client)
captured: dict[str, object] = {}

async def spy_embedding(prompt: str, metadata: dict | None = None) -> list[float]:
captured["prompt"] = prompt
captured["metadata"] = metadata
return [0.1, 0.2, 0.3]

cache._get_async_embedding = spy_embedding

await cache.async_set_cache(
key="cache-key",
value={"content": "Paris"},
messages=[{"role": "user", "content": "What is the capital of France?"}],
metadata={"user_api_key": "sk-test"},
cache_key="abc123",
custom_llm_provider="openai",
)

assert captured["metadata"] == {"user_api_key": "sk-test"}
async_client.hset.assert_awaited_once()


@pytest.mark.asyncio
async def test_async_get_cache_passes_only_metadata_to_get_async_embedding():
async_client = AsyncMock()
async_client.ft = _async_ft(0.05)
cache = _make_cache(async_client=async_client)
captured: dict[str, object] = {}

async def spy_embedding(prompt: str, metadata: dict | None = None) -> list[float]:
captured["prompt"] = prompt
captured["metadata"] = dict(metadata) if metadata is not None else None
return [0.1, 0.2, 0.3]

cache._get_async_embedding = spy_embedding

result = await cache.async_get_cache(
key="cache-key",
messages=[{"role": "user", "content": "What is the capital of France?"}],
metadata={"user_api_key": "sk-test"},
cache_key="abc123",
custom_llm_provider="openai",
)

assert result == {"content": "Paris"}
assert captured["metadata"] == {"user_api_key": "sk-test"}


@pytest.mark.asyncio
async def test_async_get_cache_misses_below_threshold():
async_client = AsyncMock()
Expand Down
Loading