TurboLLM ejecuta modelos de lenguaje reales y complejos directamente en la CPU de tu teléfono Android: sin nube, sin cuenta, sin suscripción y sin conexión a internet una vez descargado el modelo.
¿POR QUÉ IA LOCAL?
La mayoría de las aplicaciones de chat con IA son una capa superficial que utiliza la API en la nube de terceros: tus mensajes salen de tu teléfono, tus conversaciones se almacenan en un servidor que no controlas y la aplicación deja de funcionar en cuanto pierdes la señal. TurboLLM es diferente. El modelo se ejecuta en un motor de inferencia real en el dispositivo (llama.cpp, compilado para Android), y tu conversación nunca sale de tu teléfono.
QUÉ PUEDES HACER
- Chatea con modelos de lenguaje locales de peso abierto (Llama, Qwen, Gemma y cualquier otro modelo GGUF) completamente sin conexión, incluso en modo avión.
- Descubre y descarga modelos directamente desde Hugging Face, dentro de la aplicación, con un solo toque.
- El motor de inferencia se instala automáticamente la primera vez que lo necesitas: sin configuración manual, sin compilación, sin terminal.
- Crea agentes de IA personalizados con su propio sistema de indicaciones y acceso a habilidades/herramientas para diferentes tareas: ayuda con la codificación, redacción, investigación o una plantilla completamente en blanco sin instrucciones predefinidas.
- Controla tu uso a lo largo del tiempo: sesiones, mensajes, tokens totales generados, rachas y tu modelo más utilizado; todo calculado localmente a partir de tu historial.
- Ajusta la generación con controles por chat: presupuesto de pensamiento, muestreo y esfuerzo de razonamiento, para los modelos que los admiten.
- La misma interfaz que la aplicación de escritorio de TurboLLM (Windows, Mac, Linux): si has usado TurboLLM en un ordenador, tu teléfono funciona exactamente igual.
PRIVACIDAD POR DISEÑO
- Sin cuenta, sin inicio de sesión, sin almacenamiento en la nube para tus conversaciones.
- Sin telemetría, sin análisis, sin envío de informes de errores a servidores externos en esta versión.
- Los chats y los modelos descargados se almacenan únicamente en el almacenamiento privado de esta aplicación en tu dispositivo.
- Tus indicaciones, archivos y ponderaciones del modelo nunca se nos envían a nosotros ni a nadie más. Las únicas solicitudes de red que realiza esta aplicación son las que tú mismo inicias: descargar un modelo que hayas seleccionado, obtener el binario del motor de inferencia la primera vez que se necesita o una llamada a una herramienta que hayas autorizado explícitamente.
INFORMACIÓN IMPORTANTE
La inferencia se ejecuta en la CPU de tu teléfono, por lo que la velocidad depende de tu chipset y del tamaño del modelo que elijas. Los modelos más pequeños (de 1 a 4 mil millones de parámetros) ofrecen la mejor respuesta en la mayoría de los teléfonos, y los más grandes están disponibles si tu hardware los soporta. La generación activa implica un trabajo de computación real, por lo que el consumo de batería y la carga térmica serán los habituales, como en cualquier tarea de IA en el dispositivo.
PARA QUIÉN ES
Para usuarios preocupados por la privacidad, entusiastas de la IA local, desarrolladores que ya utilizan TurboLLM o llama.cpp en un ordenador y cualquier persona con curiosidad por saber cómo es un chat LLM verdaderamente offline en un teléfono: bajo tu control, en tu hardware y sin que nada salga del dispositivo.
Ejecuta seminarios web locales sin conexión en tu teléfono: chat privado con IA, sin nube, sin cuenta.