Google släpper AI-modell med 740 miljoner parametrar
Google lanserar den öppna modellen EmbeddingGemma 2 med 740 miljoner parametrar för att köra multimodal sökning lokalt i användares enheter. Den nya modellen bygger på arkitekturen Gemma 4 och hanterar både text, kod, bild, video och ljud.
Av Techindex AI ·
Google presenterar den nya modellen i ett blogginlägg och släpper den under den öppna licensen Apache 2.0. EmbeddingGemma 2 är byggd för att omvandla kombinationer av text, kod, bild, video och ljud till en gemensam representation direkt i lokal hårdvara. Lanseringen sker efter att föregångaren EmbeddingGemma nått över 20 miljoner nedladdningar sedan introduktionen i fjol.
Modellen har en modulär arkitektur som kräver 270 miljoner parametrar för enbart textuppgifter, medan tillvalen för bild och ljud omfattar 170 miljoner respektive 300 miljoner parametrar. Med kvantisering kräver den fullständiga multimodala modellen runt 567 megabyte aktivt arbetsminne på en telefon som Google Pixel 11 Pro, medan textversionen klarar sig på omkring 191 megabyte. Med tekniken Matryoshka Representation Learning kan utdatavektorerna trunkeras från 768 dimensioner ned till 128 dimensioner, vilket ger upp till 6 gånger minskad lagring för lokala vektordatabaser.
Kontextfönstret ligger på 8 000 token, vilket är fyra gånger större än i den första versionen. Det gör att modellen kan bearbeta upp till 5,5 minuter ljud, 29 bilder eller 58 videoramar lokalt. Google uppger att körning direkt på enheten minskar svarstider och skyddar data eftersom sökningar kan ske helt offline.
Vikterna för modellen finns nu tillgängliga via plattformar som Hugging Face och Kaggle, samtidigt som Google planerar att göra den tillgänglig i Gemini Enterprise Agent Platform Model Garden.
Skriven av AI och faktagranskad av en andra AI mot källan före publicering. Så arbetar vi
Så vet vi det9 uppgifter, var och en med ordagrant citat ur källanVisa
Google presenterar den nya modellen i ett blogginlägg och släpper den under licensen Apache 2.0.
”Built on the Gemma 4 architecture and released under a commercially permissive Apache 2.0 license, EmbeddingGemma 2 has 740 million parameters, making it optimal for on-device inference.”
Källa: blog.google ↗EmbeddingGemma 2 är byggd för att förena kod, bild, video och ljud i ett gemensamt representationsutrymme.
”Today, we’re launching EmbeddingGemma 2, expanding beyond text to unify code, images, video, and audio in a shared embedding space.”
Källa: blog.google ↗Föregångaren EmbeddingGemma introducerades i fjol och har laddats ned mer än 20 miljoner gånger.
”With more than 20 million downloads, builders have used it to power smarter on-device search tools and privacy-first retrieval augmented generation (RAG) pipelines.”
Källa: blog.google ↗Modellen kräver 270 miljoner parametrar för enbart text, samt 170 miljoner för bild och 300 miljoner för ljud.
”Requires as little as 270M parameters for text-only workloads with optional vision (170M) and audio (300M) encoders for full multimodal support.”
Källa: blog.google ↗Med kvantisering kräver den fulla modellen cirka 567 megabyte aktivt arbetsminne på Google Pixel 11 Pro och cirka 191 megabyte för textmodellen.
”With quantization, on a Google Pixel 11 Pro, EmbeddingGemma 2 requires as little as ~191MB active RAM for text-only weights and ~567MB for the full multimodal model.”
Källa: blog.google ↗Med Matryoshka Representation Learning kan utdatavektorerna trunkeras från 768 dimensioner ner till 128 dimensioner, vilket ger upp till 6 gånger minskat lagringsbehov.
”This provides up to 6x storage reduction for local vector databases and memory usage.”
Källa: blog.google ↗Kontextfönstret är 8 000 token, vilket är fyra gånger större än i EmbeddingGemma 1.
”Features an 8K token context window (4x larger than EmbeddingGemma 1), allowing it to process up to 5.5 minutes of audio, 29 images, 58 video frames, or interleaved combinations thereof directly on local hardware.”
Källa: blog.google ↗Lokala inbäddningar minskar svarstider och skyddar data genom att sökningar kan ske offline.
”Generating embeddings locally helps ensure data privacy, reduces pipeline latency, and empowers developers to build cross-modal search and retrieval that works entirely offline.”
Källa: blog.google ↗Modellen kan laddas ner via Hugging Face och Kaggle, och planeras bli tillgänglig i Gemini Enterprise Agent Platform Model Garden.
”Find the model weights on Hugging Face and Kaggle, with Gemini Enterprise Agent Platform Model Garden availability coming soon.”
Källa: blog.google ↗
Uppgifterna kommer ur avsändarens eget pressmeddelande, på engelska — citaten här står i originalets ordalydelse. En andra AI har jämfört översättningen med källan. Så arbetar vi
Techindex Morgon
Gårdagens technyheter i mejlen, måndag till lördag kl 06.30. Gratis, och du avslutar med ett klick.
Vi sparar bara din adress. Så hanterar vi den