Noticias de IA

No te pierdas ningún momento de la innovación global en IA

IA Diario

Tendencias diarias de la industria de la IA en tres minutos

Cronología de la IA

Hitos de la industria de la IA

Guía de Monetización de la IA

Últimos Casos

Compartiendo casos de monetización de IA

Colección de Imágenes

Casos de monetización de creación de imágenes con IA

Colección de Videos

Casos de monetización de creación de videos con IA

Colección de Audio

Casos de monetización de creación de audio con IA

Colección de Contenido

Casos de monetización de redacción de contenido con IA

Tutoriales de IA

Últimos Tutoriales

Compartiendo gratuitamente los últimos tutoriales de IA

Rankings de Productos de IA

Ranking de Productos de IA

Muestra el ranking de visitas totales de sitios web de IA

Ranking de Crecimiento de Tráfico de IA

Rastrea los sitios web de IA de más rápido crecimiento por tráfico

Ranking de Descenso de Tráfico de IA

Se centra en los sitios web de IA con descensos de tráfico significativos

Ranking Semanal de IA

Muestra el ranking semanal de visitas de sitios web de IA

Rankings de Países Populares

Estados Unidos

Sitios web de IA más populares entre los usuarios estadounidenses

China

Sitios web de IA más populares entre los usuarios chinos

India

Sitios web de IA más populares entre los usuarios indios

Brasil

Sitios web de IA más populares entre los usuarios brasileños

Rankings de Categorías Populares

Generación de Imágenes

Ranking total de visitas de sitios web de generación de imágenes con IA

Asistente Personal

Ranking total de visitas de sitios web de asistentes personales con IA

Generación de Personajes

Ranking total de visitas de sitios web de generación de personajes con IA

Generación de Videos

Ranking total de visitas de sitios web de generación de videos con IA

Rankings de Datos de Código Abierto Populares

Ranking de Proyectos de IA

Proyectos de IA populares en GitHub por estrellas totales

Ranking de Crecimiento de Proyectos de IA

Proyectos de IA populares en GitHub por tasa de crecimiento

Ranking de Desarrolladores de IA

Ranking de desarrolladores de IA populares en GitHub

Ranking de Organizaciones de IA

Ranking de organizaciones de IA populares en GitHub

Categorías de Código Abierto Populares

Deepseek

Proyectos de código abierto de Deepseek populares en GitHub

TTS

Proyectos de código abierto de TTS populares en GitHub

LLM

Proyectos de código abierto de LLM populares en GitHub

ChatGPT

Proyectos de código abierto de ChatGPT populares en GitHub

Biblioteca de Proyectos de Código Abierto de IA

Visión General

Visión general de los proyectos de código abierto de IA populares en GitHub

Biblioteca de productos Navegación de herramientas

SpeechGPT

Modelo de lenguaje multimodal

Producto ComúnProgramaciónVozMultimodal

Abrir sitio web

SpeechGPT es un modelo de lenguaje multimodal con capacidad inherente de diálogo multi-modal. Puede percibir y generar contenido multimodal, siguiendo instrucciones humanas multimodales. SpeechGPT-Gen es un modelo de generación de voz que amplía la cadena de información. SpeechAgents es una simulación de comunicación humana con un sistema multi-modal y multi-agente. SpeechTokenizer es un tokenizador de voz unificado para modelos de lenguaje de voz. La fecha de lanzamiento y la información relacionada de estos modelos y conjuntos de datos se pueden encontrar en el sitio web oficial.

Abrir sitio web

SpeechGPT Situación del tráfico más reciente

Total de visitas mensuales

521149929

Tasa de rebote

35.96%

Páginas promedio por visita

6.1

Duración promedio de la visita

00:06:29

SpeechGPT Tendencia de visitas

SpeechGPT Distribución geográfica de las visitas

SpeechGPT Fuentes de tráfico

SpeechGPT Alternativas

MiniCPM-o — MiniCPM-o 2.6: Un MLLM de nivel GPT-4o que permite transmisión en vivo visual, de voz y multimodal en dispositivos móviles.

Otros

•Multimodal•Modelo de lenguaje

378

SpeechGPT — Modelo de lenguaje multimodal

Programación

•Voz•Multimodal

1470

DeepSeek Japonés — DeepSeek es un modelo de lenguaje IA avanzado, especializado en razonamiento lógico, matemáticas y tareas de programación, disponible de forma gratuita.

Productividad

•IA•Modelo de lenguaje

276

MiniCPM-o-2_6 — MiniCPM-o 2.6 es un potente modelo de lenguaje multimodal de gran escala, adecuado para transmisión en vivo visual, de voz y multimodal.

Otros

•Multimodal•Modelo de lenguaje

492

El Lenguaje del Movimiento — Modelo unificado de lenguaje verbal y no verbal para acciones corporales 3D

Otros

•Movimiento corporal 3D•Multimodal

144

Modelo Lingüístico Spirit LM — Modelo de lenguaje multimodal que integra texto y voz

Productividad

•Multimodal•Modelo de lenguaje

270

ell — Biblioteca de programación de modelos de lenguaje ligero que trata las indicaciones como funciones.

Selección Internacional

•Modelo de lenguaje•Biblioteca de programación

306

VideoLLaMA2-7B — Modelo de lenguaje grande para video, que ofrece respuestas a preguntas visuales y generación de subtítulos de video.

Video

•Comprensión de video•Modelo de lenguaje

678

ml-ferret — Modelo de lenguaje de aprendizaje automático (MLLM) de extremo a extremo que permite la citación y localización precisas.

Programación

•Aprendizaje automático•Modelo de lenguaje

1056

JinaChat — Multimodalidad, memoria extendida, bajo coste

Chat

•Chat•Multimodal

288

Llama 3.1 Nemotron Ultra 253B — Un modelo de lenguaje grande eficiente para inferencia y chat.

Productividad

•IA•Modelo de lenguaje

DreamActor-M1 — Marco de animación de imágenes humanas basado en DiT, que permite un control preciso y una coherencia a largo plazo.

Productividad

•Animación humana•Generación de video

Fin-R1 — Modelo de lenguaje grande para el razonamiento financiero impulsado por el aprendizaje por refuerzo.

Productividad

•Finanzas•Inteligencia artificial

120

Mistral Small 3.1 — Modelo de código abierto que mejora la capacidad de procesamiento de tareas de texto y visión.

Productividad

•Multimodal•Procesamiento de texto

276

Gemini Robotics — Modelo robótico basado en Gemini 2.0, que lleva la IA al mundo físico, con capacidades visuales, lingüísticas y de movimiento.

Selección Internacional

•Inteligencia artificial•Robótica

168

Jamba 1.6 — Modelo Jamba 1.6 de AI21, diseñado para la implementación privada en empresas, con una capacidad excepcional de procesamiento de texto largo.

Productividad

•Modelo de lenguaje•Procesamiento de texto largo

156

R1-Omni — R1-Omni es un modelo de reconocimiento de emociones multimodal que combina el aprendizaje por refuerzo, y se centra en mejorar la interpretabilidad del reconocimiento de emociones multimodales.

Programación

•Multimodal•Reconocimiento de emociones

348

GO-1 — Zhiyuan lanza el primer modelo base de encarnación general GO-1, propone innovadoramente la arquitectura ViLLA e impulsa el desarrollo de la inteligencia encarnada.

Selección Nacional

•Inteligencia encarnada•Multimodal

240

SDK de Agentes de OpenAI — El SDK de Agentes de OpenAI es un kit de desarrollo para construir agentes autónomos, simplificando la orquestación de flujos de trabajo de múltiples agentes.

Selección Internacional

•Inteligencia Artificial•Agentes

516

SmolVLM2 — SmolVLM2 es un modelo de lenguaje ligero que se centra en el análisis y la generación de contenido de video.

Video

•Análisis de video•Generación de texto

210

Inception Labs — O Inception Labs lança uma nova geração de modelos de linguagem grandes difusivos, oferecendo capacidade de geração de linguagem ultrarrápida, eficiente e de alta qualidade.

Selección Internacional

•Inteligência Artificial•Modelo de Linguagem

156

OpenManus — OpenManus es un proyecto de agente inteligente de código abierto que se puede usar sin código de invitación.

Productividad

•Código abierto•Agente inteligente

828

Instella — Instella es un modelo de lenguaje de código abierto de alto rendimiento desarrollado por AMD, diseñado para acelerar el desarrollo de modelos de lenguaje de código abierto.

Programación

•Código abierto•Modelo de lenguaje

246

Aya Vision — Aya Vision es un modelo de visión multimodal multilingüe lanzado por Cohere, diseñado para mejorar la comprensión visual y de texto en escenarios multilingües.

Selección Internacional

•Multilingüe•Multimodal

168

EgoLife — EgoLife es un proyecto de asistente de IA para la vida diaria a largo plazo, multimodal y multiperspectiva, cuyo objetivo es impulsar la investigación sobre la comprensión de contextos a largo plazo.

Productividad

•IA•Multimodal

120

UniTok — UniTok es un tokenizador visual unificado para la generación y comprensión visual.

Imagen

•Inteligencia artificial•Generación visual

162

Noticias de IA

IA Diario

Cronología de la IA

Últimos Casos

Colección de Imágenes

Colección de Videos

Colección de Audio

Colección de Contenido

Últimos Tutoriales

Ranking de Productos de IA

Ranking de Crecimiento de Tráfico de IA

Ranking de Descenso de Tráfico de IA

Ranking Semanal de IA

Estados Unidos

China

India

Brasil

Generación de Imágenes

Asistente Personal

Generación de Personajes

Generación de Videos

Ranking de Proyectos de IA

Ranking de Crecimiento de Proyectos de IA

Ranking de Desarrolladores de IA

Ranking de Organizaciones de IA

Deepseek

TTS

LLM

ChatGPT

Visión General

SpeechGPT

SpeechGPT Situación del tráfico más reciente

SpeechGPT Tendencia de visitas

SpeechGPT Distribución geográfica de las visitas

SpeechGPT Fuentes de tráfico

SpeechGPT Alternativas

MiniCPM-o — MiniCPM-o 2.6: Un MLLM de nivel GPT-4o que permite transmisión en vivo visual, de voz y multimodal en dispositivos móviles.

SpeechGPT — Modelo de lenguaje multimodal

DeepSeek Japonés — DeepSeek es un modelo de lenguaje IA avanzado, especializado en razonamiento lógico, matemáticas y tareas de programación, disponible de forma gratuita.

MiniCPM-o-2_6 — MiniCPM-o 2.6 es un potente modelo de lenguaje multimodal de gran escala, adecuado para transmisión en vivo visual, de voz y multimodal.

El Lenguaje del Movimiento — Modelo unificado de lenguaje verbal y no verbal para acciones corporales 3D

Modelo Lingüístico Spirit LM — Modelo de lenguaje multimodal que integra texto y voz

ell — Biblioteca de programación de modelos de lenguaje ligero que trata las indicaciones como funciones.

VideoLLaMA2-7B — Modelo de lenguaje grande para video, que ofrece respuestas a preguntas visuales y generación de subtítulos de video.

Qwen-VL — Modelo de lenguaje visual de propósito general

imp-v1-3b — Un potente modelo de lenguaje multimodal pequeño

Honeybee — Modelo de predicción de red de lenguaje multimodal

TinyGPT-V — Modelo de lenguaje grande multimodal y eficiente

ml-ferret — Modelo de lenguaje de aprendizaje automático (MLLM) de extremo a extremo que permite la citación y localización precisas.

JinaChat — Multimodalidad, memoria extendida, bajo coste

Llama 3.1 Nemotron Ultra 253B — Un modelo de lenguaje grande eficiente para inferencia y chat.

DreamActor-M1 — Marco de animación de imágenes humanas basado en DiT, que permite un control preciso y una coherencia a largo plazo.

Fin-R1 — Modelo de lenguaje grande para el razonamiento financiero impulsado por el aprendizaje por refuerzo.

Mistral Small 3.1 — Modelo de código abierto que mejora la capacidad de procesamiento de tareas de texto y visión.

Gemini Robotics — Modelo robótico basado en Gemini 2.0, que lleva la IA al mundo físico, con capacidades visuales, lingüísticas y de movimiento.

Jamba 1.6 — Modelo Jamba 1.6 de AI21, diseñado para la implementación privada en empresas, con una capacidad excepcional de procesamiento de texto largo.

R1-Omni — R1-Omni es un modelo de reconocimiento de emociones multimodal que combina el aprendizaje por refuerzo, y se centra en mejorar la interpretabilidad del reconocimiento de emociones multimodales.

GO-1 — Zhiyuan lanza el primer modelo base de encarnación general GO-1, propone innovadoramente la arquitectura ViLLA e impulsa el desarrollo de la inteligencia encarnada.

SDK de Agentes de OpenAI — El SDK de Agentes de OpenAI es un kit de desarrollo para construir agentes autónomos, simplificando la orquestación de flujos de trabajo de múltiples agentes.

SmolVLM2 — SmolVLM2 es un modelo de lenguaje ligero que se centra en el análisis y la generación de contenido de video.

Inception Labs — O Inception Labs lança uma nova geração de modelos de linguagem grandes difusivos, oferecendo capacidade de geração de linguagem ultrarrápida, eficiente e de alta qualidade.

OpenManus — OpenManus es un proyecto de agente inteligente de código abierto que se puede usar sin código de invitación.

Instella — Instella es un modelo de lenguaje de código abierto de alto rendimiento desarrollado por AMD, diseñado para acelerar el desarrollo de modelos de lenguaje de código abierto.

Aya Vision — Aya Vision es un modelo de visión multimodal multilingüe lanzado por Cohere, diseñado para mejorar la comprensión visual y de texto en escenarios multilingües.

EgoLife — EgoLife es un proyecto de asistente de IA para la vida diaria a largo plazo, multimodal y multiperspectiva, cuyo objetivo es impulsar la investigación sobre la comprensión de contextos a largo plazo.

UniTok — UniTok es un tokenizador visual unificado para la generación y comprensión visual.