Un nuevo modelo con viejos problemas
El reciente lanzamiento de Fable, el modelo de inteligencia artificial de Anthropic, ha desatado un torrente de críticas en la comunidad de ciberseguridad. Presentado como una versión pública y limitada del aclamado modelo Mythos, Fable se enfrenta a un dilema significativo: sus estrictas restricciones están limitando su utilidad para los profesionales del sector.
Desde su lanzamiento, varios investigadores han expresado su frustración ante las medidas de seguridad implementadas en Fable. La conocida investigadora Valentina “Chompie” Palmiotti, quien trabaja en IBM X-Force, comentó que el modelo rechaza incluso solicitudes que podrían considerarse inofensivas, como leer un blog sobre ciberseguridad. Según Palmiotti, “Fable pausa la conversación y señala que sus medidas de seguridad han bloqueado este mensaje por estar relacionado con temas cibernéticos o biológicos”.
A pesar de las buenas intenciones detrás de estas guardrails, muchos expertos consideran que su implementación es demasiado rígida. Matt Suiche, un veterano en ciberseguridad y miembro del equipo técnico en Tolmo, una startup dedicada a la ciberseguridad basada en IA, afirmó que “si le pides que escriba código seguro, asume que se trata de trabajo relacionado con ciberseguridad y no sigue las mejores prácticas de ingeniería de software”. Esto provoca una degradación del servicio cuando se activa el guardrail.
A pesar del descontento generalizado, algunos expertos creen que estas restricciones son parte del proceso evolutivo necesario para mejorar los modelos. Suiche añadió: “Es comprensible ya que estamos aún en los primeros días y ellos están adaptando sus guardrails. Estoy seguro de que evolucionarán con el tiempo a medida que Anthropic colabore más con la nueva generación de empresas dedicadas a la ciberseguridad”. Esta perspectiva optimista resuena entre aquellos dispuestos a dar tiempo al desarrollo tecnológico.
Aparte de las limitaciones impuestas por Fable, Anthropic ha establecido un programa llamado Cyber Verification Program. Este permite a los profesionales aprobados tener acceso a menos restricciones al utilizar Claude para trabajos relacionados con ciberseguridad. Un enfoque similar es seguido por OpenAI con su programa Trusted Access for Cyber.
A medida que el debate continúa sobre la efectividad y necesidad de estas restricciones, queda claro que el camino hacia una inteligencia artificial segura y útil es complejo. La comunidad espera ver cómo Anthropic ajustará sus políticas mientras navega por este delicado equilibrio entre seguridad e innovación.


