Modelos de IA no dispositivo para iOS e macOS
Pacotes Swift prontos para usar que rodam modelos pequenos e especializados no dispositivo, no iOS e no macOS, em poucas linhas de código sobre o Core ML.
Todo modelo disponível da Desert Ant Labs é distribuído como um pacote Swift construído sobre o Core ML, com async/await do começo ao fim e uma API que parece parte do AVFoundation.
Adicione o pacote no Xcode e chame o modelo. Tudo roda no dispositivo, então áudio, imagens e texto nunca saem dele.
Modelos disponíveis
Ocultação reversível de PII em 27 idiomas, a partir de um modelo Core ML de 12 MB embutido no app.
Sugestões de emoji a partir de texto em menos de 2 ms, pequeno o bastante para rodar a cada tecla.
Temas de conteúdo a partir de qualquer texto, em 101 idiomas, de um modelo Core ML de 74 MB, ou uma build de 15 MB só em inglês.
Encaixe de formas no PencilKit com uma chamada, a partir de um modelo Core ML de 0,2 MB, sem download.
Melhoria de fala DeepFilterNet 3 no Core ML: 302x o tempo real em um iPhone 16 Pro, um clipe de 5 minutos em 1 s.
Detecção de palavras de preenchimento com precisão de quadro, direto da forma de onda, sem transcrição.
Identificação de idioma para texto curto, entre 84 idiomas, de um modelo de 2 MB incluído no app.
Marcações de palavra mais justas para qualquer transcrição, metade do erro, a partir de um modelo Core ML de 0,7 MB. Apple Speech primeiro.
Shorts e destaques a partir de uma transcrição, ranqueados, um vídeo de 25 minutos em 9 s no Core ML.
Identificação de idioma falado em 99 idiomas a partir de 30 segundos de áudio, no Core ML.
Um título e uma descrição de uma ou duas frases para qualquer trecho, no Apple silicon via MLX.
Fala em texto com marcações por palavra, 25 idiomas, inteiramente no Neural Engine: 10 minutos de áudio em 2 s em um iPhone.
Em breve
Sinalize nudez antes do upload ou da exibição.
Extraia JSON tipado de qualquer texto.
Marque e classifique imagens.
Marque quem disse o quê em áudio e vídeo.
Encontre pessoas em fotos, de forma privada no dispositivo.
Preços
Cada modelo é gratuito para até 100 mil dispositivos ativos mensais por SDK. Inferência ilimitada por usuário.