Proporciona una API de moderación de contenido totalmente compatible con los estándares de OpenAI, que permite a los desarrolladores utilizar esta interfaz para identificar automáticamente contenido dañino (como discurso de odio, violencia, actividades ilícitas, etc.) en texto o imágenes mediante modelos de moderación multimodales, garantizando el cumplimiento de la aplicación.
import openaiclient = openai.OpenAI( api_key="AIHUBMIX_API_KEY", base_url="https://aihubmix.com/v1")response = client.moderations.create( model="text-moderation-latest", input="The Yangtze River rolls eastward, its waves washing away heroes. Right and wrong, success and failure, all seem empty; the green hills remain, though the sun sets many times. The white-haired fisherman and woodcutter on the riverbank, accustomed to watching the autumn moon and spring breeze. A pot of turbid wine brings joy in meeting, how many events through time are all laughed off.",)print(response)
import openaiclient = openai.OpenAI( api_key="AIHUBMIX_API_KEY", base_url="https://aihubmix.com/v1")response = client.moderations.create( model="omni-moderation-latest", input=[ {"type": "text", "text": "The image depicts a male, with his arms raised, body tense, head tilted back, mouth open, showing extreme agitation or anger."}, { "type": "image_url", "image_url": { "url": "https://thumbs.dreamstime.com/b/violent-man-furious-straining-arms-looking-up-concept-person-35012557.jpg", # can also use base64 encoded image URLs # "url": "data:image/jpeg;base64,abcdefg..." } }, ],)print(response)
El resultado de salida incluye varias categorías en la respuesta JSON, que te informan sobre los tipos de contenido presentes en la entrada (si los hay) y hasta qué punto el modelo cree que están presentes.
Categoría de salida
Descripción
flagged
Se establece en true si el modelo clasifica el contenido como potencialmente dañino; false en caso contrario.
categories
Contiene un diccionario de indicadores de infracción por categoría. Para cada categoría, el valor es true si el modelo marca la categoría correspondiente como infringida, false en caso contrario.
category_scores
Contiene un diccionario con las puntuaciones por categoría generadas por el modelo, que indican la confianza del modelo en que la entrada infringe la política de OpenAI para esa categoría. El valor está entre 0 y 1, donde los valores más altos indican mayor confianza.
category_applied_input_types
Esta propiedad contiene información sobre qué tipos de entrada se marcaron en la respuesta, para cada categoría. Por ejemplo, si tanto la entrada de imagen como la de texto se marcan por “violence/graphic”, la propiedad violence/graphic será ["image", "text"]. Solo está disponible en modelos omni.
La tabla siguiente describe los tipos de contenido que la API de moderación puede detectar, junto con los modelos y tipos de entrada admitidos para cada categoría.
Las categorías marcadas como “solo texto” no admiten entrada de imagen. Si envías solo imágenes al modelo (sin texto) usando omni-moderation-latest, el modelo devolverá una puntuación de 0 para esas categorías no admitidas.
Categoría
Descripción
Modelo
Entrada
harassment
Contenido que expresa, incita o promueve lenguaje de acoso hacia cualquier objetivo.
Todos
Solo texto
harassment/threatening
Contenido de acoso que además incluye violencia o daño grave hacia cualquier objetivo.
Todos
Solo texto
hate
Contenido que expresa, incita o promueve odio basado en raza, género, etnia, religión, nacionalidad, orientación sexual, discapacidad o casta. El contenido odioso dirigido a grupos no protegidos (p. ej., jugadores de ajedrez) es acoso.
Todos
Solo texto
hate/threatening
Contenido odioso que además incluye violencia o daño grave hacia el grupo objetivo basado en raza, género, etnia, religión, nacionalidad, orientación sexual, discapacidad o casta.
Todos
Solo texto
illicit
Los mismos tipos de contenido marcados por la categoría illicit, pero que también incluyen referencias a violencia o a conseguir un arma.
Solo Omni
Solo texto
illicit/violent
Similar al tipo de contenido marcado como illicit, pero que también incluye menciones a la violencia o a la obtención de armas.
Solo Omni
Solo texto
self-harm
Contenido que promueve, fomenta o representa actos de autolesión, como el suicidio, los cortes o los trastornos alimentarios.
Todos
Texto e imágenes
self-harm/intent
Contenido en el que el hablante expresa que participa o tiene la intención de participar en actos de autolesión, como suicidio, cortes y trastornos alimentarios.
Todos
Texto e imágenes
self-harm/instructions
Contenido que fomenta la realización de actos de autolesión, como el suicidio, los cortes y los trastornos alimentarios, o que da instrucciones o consejos sobre cómo cometer dichos actos.
Todos
Texto e imágenes
sexual
Contenido destinado a despertar excitación sexual, como la descripción de actividad sexual, o que promueve servicios sexuales (excluyendo la educación sexual y el bienestar).
Todos
Texto e imágenes
sexual/minors
Contenido sexual que incluye a una persona menor de 18 años.
Todos
Solo texto
violence
Contenido que representa muerte, violencia o lesiones físicas.
Todos
Texto e imágenes
violence/graphic
Contenido que representa muerte, violencia o lesiones físicas con detalles gráficos.