Curso recomendado

Mostrando entradas con la etiqueta software libre. Mostrar todas las entradas
Mostrando entradas con la etiqueta software libre. Mostrar todas las entradas

martes, 8 de marzo de 2011

Data Mining - Rstudio

La verdad es que el compañero Carlos ya se nos adelantó en su blog al dar la noticia, había nacido un nuevo IDE free para R, Rstudio. Me miré el post y me apunté mentalmente darle un vistazo a fondo al programa, cosa que aún no he podido hacer...

Hasta aquí lo normal, pero revisando los post que tenía por leer me he dado cuenta que en la comunidad de R ha pegado muy muy fuerte, he podido leer posts en multitud de sitios sobre la bondades de este nuevo IDE; la verdad es que por ahora, y según lo que yo he podido ver, no aporta mucho más que, por ejemplo, JGR; cierto es que permite hacer artículos científicos de manera más fácil e integrada, pero a parte de eso yo diría que son prácticamente iguales; bueno mirando un poco más de cerca permite que se instale en un linux y poderte conectar via web al IDE... no es mala opción si lo que quieres es trabjar con un servidor potente en el cual no estás físicamente delante.

Sinceramente hasta que alguno de estos IDE's no integre la debugacción de código estaremos algo cojos de interface... no se si habéis intentado debugar algo en R... es un ejercicio que medirá el nivel de paciencia que tenemos, y si me no creéis intentad lo. Esto siempre hablado en software libre, por que Revolution Analytics ya tiene una IDE que integra debugación y, si las noticias son ciertas, esta trabajando en una interface mucho más visual, digamos que muy cercana a Clementine.

De todas maneras no quiero se escéptico, a ver si por una vez por todas conseguimos que se haga un IDE más amigable para R, que sea multiplataforma y que cubra todas las necesidades que un buen IDE debe tener... ¿será Rstudio este? el tiempo nos lo dirá.

Eso si, está claro que es mucho más bonito que la línea de comandos de R...


lunes, 21 de febrero de 2011

Data Mining - MADlib libreria para hacer Data Mining en BBDD

Ya cada vez más tenemos todo tipo de iniciativas, la última y que más me ha llamado la atención es MADlib.

Hace ya unos años todas las empresas de BBDD añadieron algoritmos de minería a sus distribuciones, me acuerdo que teníamos más de una discusión sobre si era por que quería orientarse la empresa al analítico o por el hecho que sus divisiones de analítico no habían conseguido cuajar y aprobechaban el trabajo hecho dando alguna funcionalidad más a sus productos estrella; la verdad es que no he visto ningún proyecto de analítico que tuviera como soporte este tipo de software...

Ahora con MADlib tenemos más o menos lo mismo pero en software libre, una librería para hacer en BBDD, en concreto parece que en principio la BBDD GPL que lo soporta es PostgresSQL, aunque parece que también soportará a Greenplum, una BBDD propietaria que no tenía este tipo de servicios; en si parece que Greenplum se ha asociado con "Data Research Group" de la universidad de Berkely para desarrollar esta funcionalidad.

En lo que respecta a la utilidad, pues la verdad dudo que llegue a suplir la necesidad de algún software de análisis de datos a la hora de construir modelos, sinceramente considero mucho más interesante tener la capacidad de explotarlos, es decir, de importar modelo en PMML y explotarlo y no me extrañaría nada que al final esta herramienta se le añadiera esta capacidad, es más, creo que es un objetivo final ya que está en una fase muy inicial de desarrollo y todavía no se sabe hacia donde derivará.

Siceramente si al final es capaz de explotar PMML, si se le da soporte a más BBDD (uno de los puntos donde dicen que tienen que crecer) podría convertirse en una herramienta muy interesante dentro del mundo GPL, si no coge este camino dudo que tengamos más noticias sobre él.

jueves, 3 de febrero de 2011

Data Mining - SAS contra las cuerdas por Pentaho

Que los enanos que le estaban creciendo a SAS están ya en la universidad y que apuntan maneras no es ningún secreto, en concreo tenemos a WPS, que según nuestro compañero Raúl Vaquerizo del blog Análisis y Decisión nos permitiría una migración a una solución mucho más barata es totalmente factible y que conste que Raúl es un experto en SAS.

Por otro lado nos tramos noticias como la siguiente donde nos van haciendo una analogía entre SAS y el mundo del software libre; hya un punto muy interesante que es la comparación de la posición de Microsoft con respecto a Linux, donde Bill Gates decía que el software libre no cubría las necesidades de un usuario profesional y que sería sólo utilizado por aficionados; lo mismo pasó cuando surgieron las bases de datos libres... ya ahora es SAS que el software libre no se puede utilizar en su negocio...

Es muy intereante la gráfica sobre el nivel de búsquedas de SAS frente a Pentaho que nos encontramos en el articulo antes mencionado; si fuera el CEO de SAS estaría muy pero que muy preocupado.

Es cierto que a nivel profesional sólo SPSS (o IBM) puede competir con SAS a nivel analítico, que los clientes de SAS normalmente son clientes que búscan un software analítico y que esto todavía lo tiene que mejorar mucho Pentaho (también hay que recordar que adquirio WEKA por lo tanto está en ello), pero también es cierto que hay otras soluciones para suplir ahora mismo esta deficiencia, el siempre comentado R, y si no recuerdo mal estaban trabajando en enlazar R con Pentaho con algún resultado ya.

Por otro lado recordar que también se puede utilizar soluciones muy comentadas en este blog como son Knime y Rapidminer para solucionar la parte de minería de datos dejando Pentaho para temas de reporting, cubos, carga de BBDD...

Primero fueron los sistemas operativos, luego las BBDD, continuaron con los desarrollos de middlware... parece que ahora ya le toca al BI y a los desarrollos analíticos ¿no creéis?

viernes, 24 de septiembre de 2010

Data Mining - Noticias sobre Knime y Rapid Miner.

Hoy os traigo un par de buenas noticias para nuestro pequeño mundo, la minería de datos.

Por un lado Knime ha sido nombrado por Gartner como Cool Vendor 2010, según Gartner, como Cool Vendor 2010, esto quiere decir, que según esta firma, que Knime tiene funcionalidades muy interesantes que aun no han sido explotadas por el mercado.

Hay que recordar que Gartner no es cualquiera, lleva años haciendo análisis sobre el diferente software existente de minería de datos, incluso tiene un cuadrante especifico sobre el tema donde compara las diferentes herramientas.

Espero que esto sea el pequeño espaldarazo que necesita la herramienta para llegar a un público más global y que tengamos más competencia en un mundo que es muy limitado.

Por otro lado tenemos que Rapid Miner ha publicado ya su nueva versión con nueva interface, podéis verla en estos videos,y lo que es más importante, se ha enlazado con R. Esto hace que una herramienta que tiene una cantidad de análisis muy interesante añada facilidad de uso así como flexibilidad, 2 puntos que yo consideraba que flojos en la herramienta.


Es muy interesante ver como el mercado da oportunidades a estas herramientas que están creciendo a la sombra de los monstruos SAS y SPSS-IBM; estoy seguro que con la migración que va a haber hacia estos nuevos sistemas más de uno se va a replantear su política de precios.

martes, 7 de septiembre de 2010

Data Mining - useR! 2010

Hola a todos, después de un tiempo de silencio retorno a estar por aquí,a ver si puedo postear con más asiduamente.

Hoy, aunque sea un poco tarde, os traigo la noticia de que ha finalizado la useR! 2010; pero lo que es más importante, han colgado gran parte de las presentaciones en la red.

En esta edición ya han creado un subapartado que trata temas de BI, en concreto nos podemos descargar las presentaciones de:
  1. Analizando datos de marketing directo con R
  2. El rol de R dentro de la arquitectura de software del BI
También he visto algún paper interesante sobre el analisis de redes sociales con R, data mining con árboles, o la presntación de Red-R, entre otros.

Os recomiendo que os paséis por la página ya que seguro que encontrais temas interesantes que seguro que se pueden aplicar a vuestro trabajo.

lunes, 3 de mayo de 2010

Data Mining - Entornos visuales de programacion para R.

Llevamos algún tiempo donde se ha intentado llevar la programación a un publico más amplio, ya sea haciendo más sencillos los lenguajes de programación, con entornos más visuales e incluso haciendolos más visuales.

Ya hablamos en su día sobre el punto de inflexión que se dió cuando Clementine lanzó una interface visual con capacidad de hacer análisis estadísticos y de minería de datos, poco a poco muchas herramientas han seguido este camino, y ahora nos encontramos que R, con todo lo geek que es todabía, está tomando también este camino, no desde el core de la aplicación pero si que encontramos aplicaciones para dar una apariencia más amigable.
Por un lado tenemos los entornos de programación mejorados, es decir, tenemos que seguir picando código si o si pero nos dan más información que la consola simple de R, que la verdad es muy sosa.
JGR es una aplicación hecha en Java y GPL, por lo tanto se puede utilizar tanto en linux, windows o MAC; no está mal, lo he utilizado más de una vez y la verdad es que se agradece tener sintaxis con colores y sangrados, para que os hagais una idea de que pinta tiene os dejo aquí un pantallazo.



Rkward es una aplicación GPL y nativa de linux, por ahora ya que hay planes para portarla a windows, donde encontraremos un entorno de programación integrado y completo, mi acercamiento a esta herramienta es muy limitada, pero la verdad es que pinta interesante.


Ya hace un tiempo os hablamos de Revolution Computing, esta empresa tiene un entorno muy parecido a los anteriores pero con una mejora importante, su herramienta nos permite hacer debugación paso a paso, cosa que ni en R ni en estas aplicaciones tiene una solución que sea sencilla.

Ya con otro tipo de finalidad, acercarnos más al concepto herramientas como SPSS, StarGraphics o Minitab por poner algún ejemplo, tenemos R Comander. A mi personalmente no me gusta, ya que prefiero utilizar R como un lenguaje de programación, pero tengo que reconocer que si sólo quieres hacer lagún gráfico o calcular un estadistico puntualmente tiene su utilidad.



Una vez vistas las mejoras del IDE de R ahora nos centraremos en los nuevos conceptos basados sobre todo en la programación visual. Ya tuvimos un avance lo que podía ser este tipo de interface con la API de R que existe Knime, pero como era de suponer ya se han hecho acercamientos desde otras herramietas totalmente centradas en R.

Por un lado tenemos RAnalyticFlow, no es una herramienta nueva, y contra mi opinión, ha continuado actualizandose. Ya en la UseR Conference de 2008 se nos presentó esta herramienta y la verdad es que me pareció muy interesante su intención de acercar la programación visual a R. Para que os hagais una idea aquí os dejo un pantallazo.



Y por último, pero no menos imporatante, la última aportación de la comunidad Red-R, tiene una interface vasada en orange (una herramienta de mienría GPL que cuando tenga algo de tiempo espero hablaros de ella), por lo que he visto es algo más encorsetada que el IDE anterior pero bueno poco apoco. Aquí teneis un pantallazo.

El tiempo dirá pero yo creo que este tipo de soluciones no apartará a la interface de R por defecto, a no ser que esa el mismo proyecto que acoja una como propia, la verdad es que no importa mucho, todos los IDE's tienen pros y contras, lo importante es que se está intentando acercar R a otro tipo de usuarios y poco a poco esta herramienta va cubriendo más necesidades.

lunes, 30 de noviembre de 2009

Data Mining - Rapid Miner

Hoy os presentaré otra herramienta GPL para hacer minería de datos, creo que ya llevamos 3 y eso que no hemos entrado en las librerías de programación libres, para que luego digan que no hay opciones en el software libre.

Se llama RapidMiner; esta herramienta nace de Yale (Yet Another Learning Environment), una herramienta totalmente gratuita centrada en la investigación de algoritmos de machine learning, con el tiempo se creo una empresa a su alrededor que lo ha estado desarrollado la herramienta desde, más o menos, el 2006.

El resultado, cuando menos, es interesante. Esta herramienta permite ejecutar los algoritmos de Weka dentro de su interface, a demás, en la proxima versión podrán en marcha una nueva interface mucho más visual que la anterior, os dejo un enlace con un vídeo aquí .

Esta herramienta ha ganado varios premios, ha sido la mejor startup de Alemania en el 2007, el año pasado gano otro premio centrado en las Startup de Business, pero lo que considero más interesante es el hecho que se ha metido dentro, como observador, del comite del Data Mining Group, esto quiere decir que en breve soportará exportación e importación de modelos en PMML, pero a demás desde su puesto estará al tanto de la evolución de este formato y podrá aplicar la modificaciones de una manera rápida. Esto es más importante de lo que parece en un principio, ya que se auguran tiempos donde la herramienta de modelización estará desvinculada de la de explotación.

Esta empresa, como otras dentro del software GPL, han optado por el doble producto, uno totalmente libre donde la comunidad puede hacer lo que quiera, y otro Enterprise, donde hay que pagar un precio por el producto, la verdad que no muy abultado, con 9999€ una versión con instalaciones ilimitadas y con un soporte con una respuesta en menos de 2 horas. Os dejo el enlace con las tarifas aquí.

Bueno pues ya tenemos otro entorno donde poder hacer nuestro análisis, ya me contareis que os parece.

viernes, 27 de noviembre de 2009

Data Mining - Knime Reporting

Hace casi nada que os hablamos de Knime, pues hoy ha salido a la luz una nueva funcionalidad muy interesante, la capacidad de hacer reporting con esta herramienta.

Sinceramente cuanta más tiempo pasa más interesante me parece esta herramienta, para que os hagáis una idea o dejo un pantallazo de la nueva funcionalidad justo debajo de estas líneas


Aunque seguro que tiene limitaciones es una capacidad muy interesante, ya que en la misma herramienta tenemos la capacidad de hacer ETL, es decir, que podemos hacer informes con información sucia de cualquier fichero txt o excel, que aunque todo técnico de BI nos dirá que si no está en la BBDD no se puede trabajar con ello o en su defecto se tiene que hacer una petición para que se incluya la información, todos sabemos que las peticiones de información que nos hacen son siempre urgentes y no son estandarts.

Os dejo aquí la página que contiene un par de vídeos para que os hagáis una idea de como funciona todo el conjunto.

Sinceramente cada vez estoy más convencido que escucharemos cosas muy interesantes sobre esta herramienta, ETL, Minería, Reporting, capacidad de exportar a PMML, capacidad de ejecutar escripts de Python y R...

miércoles, 11 de noviembre de 2009

Data Mining - Estudio BI Open y R

Me hago eco de la noticia que ha publicado un gran blog de BI, TodoBi.

En la entrada comentan un estudio de BI Open Source realizado por Mark Madesn. En la página de TodoBi tenéis el pdf completo el cual podéis descargar, no tiene desperdicio; pero yo sólo quería hacer mención al siguiente gráfico:


Se puede observar que la parte donde más crecimiento hay en Open Source es en la división de analítico; esto puede ser por inercia, me encontrado con más de un consultor de riesgo que se le ponen los pelos de punta cuando dices de hacer un score sin SAS, falta de técnicos cualificados, miedo al cambio entre otros; pero la conclusión que tengo en mente al ver el gráfico es que no es nada descabellado que en medio plazo más del 30% de las empresas tengan sus departamentos de analítico funcionando en software libre, que es lo que hay actualmente en sistemas de BBDD Open.

Pero lo más interesante ha sido que hace unos días leí en el blog de REvolution una entrada sobre la opinión de R de Steve Miller, nos comenta que a SAS le están creciendo los enanos, la existencia de REvolution, productos que copian la sintaxis de SAS (WPS, Carolina), pero lo que cree que le va ha hacer más daño a medio plazo es que ahora en las universidades ya se enseña R y no SAS; no puedo estar más deacuerdo en el punto donde nos explica que de aquí a unos 5 años R será la herramienta preferida para los nuevos estadísticos en el mundo empresarial.

LLevamos tiempo con vientos de cambio en todo lo relacionado con el software, y parece que ahora ya le toca al mundo analítico, y lo más interesante es que ahora es cuando ya no se discute en las organizaciones si es necesario hacer análisis, sino como se hacen y que nos cuesta hacerlos; en una situación como la actual, con una crisis acuciante, el open source no es visto como un un medio de apredizaje relegado a las universidades, sino como una opción más que valida para las organizaciones.

martes, 13 de octubre de 2009

Geomarketing y Data Minning

Un tema muy interesante, y que nos une a los profesionales del GIS y del Data Minning, es la posibilidad de integrar plataformas de ambas tecnologías.

Francisco Ortega nos ha ido presentando diferentes alternativas, como K-Mine o R, ambas de software libre, con una potencialidad muy elevada, lo que ha hecho que diferentes empresas se empiecen a plantear la posibilidad de usar estas herramientas en detrimento de las comerciales como Clementine.

Pues hoy leyendo el foro de Gabriel Ortiz, del cual soy asiduo lector, me he encontrado con un nuevo grupo, GIS&Chips, con un interés común: el desarrollo de y con software libre en el ámbito de las tecnologías de la información geográfica.

He estado leyendo su web, y tienen posts muy buenos relacionados con:
  • Análisis de Redes: Uno de los inconvenientes más importantes que se tienen a la hora de afrontar el análisis de redes no es la tecnología, si no más bien, las propias redes. Estamos habituados a trabajar con NavTeq o TeleAtlas, pero ellos han conseguido trabajar con OpenStreetMap. Muy, pero que muy interesante, más que nada porque OSM sigue creciendo de manera exponencial.
  • Integración de R con PostGres: Su propio nombre lo indica, y no hay que olvidar que PostGres tiene una extensión PostGIS, por lo que podemos enlazar muy comodamente los modelos de R con nuestras aplicaciones de Geomarketing.
Mi más sincera enhorabuena a la gente de GIS&Chips

jueves, 1 de octubre de 2009

Data Mining - Knime

Bueno por fin estoy de nuevo por aquí, hoy os presentaré una nueva aplicación de software libre que promete convertirse con el tiempo en una de opciones más interesantes a la hora de hacer nuestros proyectos, esta se llama KNIME.

Esta herramienta utiliza una interficie muy parecida a Clementine y no sólo para ayudarnos a la hora de hacer análisis con los datos, sino que también nos permite tratar datos, es decir, podemos crear procesos de ETL dentro del mismo entorno en el cual hacemos análisis; esto hace que, desde mi punto de vista, esta herramienta sea la más accesible para el neófito dentro del mundo GPL.

Otro punto muy interesante es que está programada en JAVA, osea que es independiente de plataforma, es decir, que corre igual en Windows, Linux o Mac.

Bueno pero dejemos la teoría y veamos que pinta tiene un proceso de esta herramienta, justo debajo de estas líneas tenéis uno de los procesos más clásicos de cualquier herramienta de minería de datos, el entreno de un árbol de decisión así como su explotación.

Sinceramente a mi me recuerda a una mezcla entre Weka y Clementiene... Si queréis ver la herramienta en funcionamiento tenéis un par de vídeos aquí.

Pero lo mejor de todo es que esta herramienta a partir de ampliaciones permite ejecutar script's de R, incluidos gráficos, y también permite ejecutar gran cantidad de algoritmos importados de Weka, a demás de permitir crear tu propios nodos, siempre y cuando te veas con corazón de desarrollarlos. Esta capacidad de tener unas API's generalistas que permiten a los usuarios diseñar sus propios procesos es una capacidad muy a tener en cuenta, ya que hará que la herramienta crezca con el soporte de los usuarios, incluso ya hay empresas que desarrollan sus propios nodos.

La capacidad de agrupar otras herramientas GPL que no tienen buenas capacidades de "movimiento de datos" (recordamos que R tiene problemas para tratar grandes volúmenes de datos y a Weka le pasa exactamente igual) dentro de un entorno gráfico amigable, capaz de hacer procesos ETL de manera eficiente y llamar a herramientas de modelización justo en el punto que se necesita es un grandísimo acierto. Otro punto donde han dado en el clavo es que tiene capacidad de guardar los modelos en PMML, por lo tanto podemos crear nuestros modelos Knime y explotarlos con cualquier herramienta que sea capaz de importar PMML, o al reves, podemos crear nuestros modelos con otra herramienta y explotarlos en KNIME.

Por último decir que el software es gratuito, aunque hace unos meses pusieron a la venta un servicio de soporte por unos 2000€ anuales para un único usuario, irrisorio si lo comparamos con cualquier mantenimiento de otra herramienta privativa.

Sicéramente intuyo que esta herramienta va a dar mucha guerra en un futuro a medio plazo, el modelo de negocio de permitir que cualquiera desarrolle sobre su plataforma pero que el soporte se pague a parte es un clásico dentro del mundo GPL, y ya hay muchas empresas que han conseguido su nicho de mercado como Red Had o Suse con este tipo de modelo y no me extrañaría nada que Knime consiguiera introducirse en el mercado totalmente dualizado entre SAS y SPSS haciendo que las cosas cambien.

lunes, 27 de julio de 2009

Data Mining - Video Lectura de R y Weka

Tengo que reconocer que que soy un enamorado del software libre, me encanta la idea que se hagan cosas para todos, donde todos podamos trabajar y aportar, la verdad es un concepto que considero que estará muy presente en nuestro futuro.

Dentro de mi campo, la minería de datos, hay dos grandes herramientas GPL. R ya os hablé de ella, para mí es la que más futuro tiene por su versatilidad, es un leguaje de programación por lo tanto se puede hacer de todo, desde crear un directorio en el pc que estés trabajando, hasta diseñar un paquete que te sirva para expotar los informes finales a pdf, sin mencionar la gran de opciones analíticas y gráficas que contiene.

La otra grande es Weka, es una aplicación echa en JAVA que contiene todo lo necesario para hacer análisis de minería de datos, desde conexión a bases de datos por ODBC, algoritmos de selección de variables, todo tipo de modelos para ajustar a nuestros datos, diferentes manera de definir la evaluación de los modelos y mil cosas más.

Podeis encontra más información en un libro que hicieron los autores de Weka que está bastante bien, os dejo aquí el enlace.

Para que os hagáis una idea de como son los dos paquetes os dejo aquí una presentación que hizo Luís Benache, un profesor de la Universidad de Valencia sobre esto paquetes comentando su capacidad de hacer análisis. Espero que la encontréis interesante.


domingo, 5 de julio de 2009

Data Mining - R


Durante mis años de universidad tuve la suerte de ver crecer una herramienta GPL que en principio me parecía fea y difícil de usar, y con el tiempo me ha convencido que no hace falta un interfaz bonito y pagar grandes cantidades de dinero para hacer buenos análisis; esta herramienta se llama R.

Con el tiempo este proyecto me ha ido convenciendo que es una de las mejores herramientas que existen en la actualidad. Fue creada a principios de los 90 cómo una replica gratuita de S+, unos de los mejores entornos de análisis de datos que ha habido nunca, el cual ha venido a menos por culpa de su hermano libre. Hay que reconocer que los principios no fueron nada fáciles, muchísimos bugs, grandes problemas de compatibilidad, rendimiento computacional muy limitado... pero sus creadores no se rindieron, y durante estos 20 años de desarroyo se ha conseguido hacer una herramienta de una potencialidad increible, ¿por qué digo esto? pues es muy sencillo, R es un lenguaje de programación con grandes capacidades para representar información de forma gráfica amén de tener infinidad de funciones y algoritmos orientados al análisis de datos y, lo que es más importante, unas API's bien definidas que permiten que cualquier usuario con conocimientos de C pueda crear sus propios paquetes.

Esta capacidad de expandirse de manera sencilla y abierta por todo el publico ha sido uno de los grandes aciertos de los desarrolladores, ha permitido que el número de paquetes de R haya crecido exponencialmente hasta más de 1700 que existen actualmente, ¿y que podemos encontrar en estos paquetes? de todo, creo que hay muy pocos campos del analisis de datos que no estén tratados por un paquete de R, desde la conexión a base de datos, cual tipo de análisis imaginable, generación de informes automáticos, todo tipo de gráficos, ... incluso se han creado diferentes agregaciones de paquetes que tratan diferentes campos en concreto, os dejó aquí la página donde podéis ver todos los grupos, eso sí, os comento los que considero más importantes para hacer minería de datos; estos son Machine Learning, análisis multivariante, optimización, computación de alto rendimiento y paralela, análisis de grupos, gráficos y como no análisis de datos espaciales. Que quede constancia que le lanzo un guante a mi compañero Jesús para que realice algún test sobre las capacidades espaciales del programa y nos lo cuente comparando capacidades con otras herramientas, hay queda.

Teniendo en cuenta como está la situación actual, donde la competencia es aférrima, tener una capacidad de hacer análisis de manera rápida y fiable es imprescindible y que todas las entidades tienen reducción de costes considero una opción más que valida R, recordemos que hace relativamente poco hablamos sobre que se ha ganado la KDD Cup trabajando sobre R, es decir que potencialidad para el modelización no le falta; imaginaros el departamento de expertos que se podría formar sólo con el coste de la implantación de alguna de las herramientas de minería privativas.

Imaginad como está situando la industria a R como competencia que han empezado ha enlazarlo con sus propios lenguajes, aquí podemos observar como SPSS permite desde su herramienta llamar a R para hacer análisis, por otro lado en esta notícia nos comenta que SAS también incorporará esta capacidad, algo se tiene que estar moviendo para que los grandes permitan utilizar este software libre desde susherramientas; aquí podríamos aplicar eso de "Si no puedes con el enemigo únete a él".

Y la verdad es que no me extraña este movimiento generalizado de toda la industria, cada vez veo más noticias que grandes empresas han utilizado R para sus trabajos analíticos, os dejo aquí un video donde se nos explica como Facebook y Google, entre otras, utilizan R para sus análisis.

Otra noticia que me sorprendió es que se les hizo una entrevista a los creadores del programa en el New York Times, esto puede parecer que no es importante, pero que en un medio que no es expecializado ni académico se haga eco de una herramienta GPL y nos hable bien de ella es muy importante, aunque sólo sea para dar algo de publicidad.

Sinceramente
, desde mi punto de vista, se abre una oportunidad impresionante aquí en España, creo que la primera empresa que apueste por esta herramienta, que haga alianzas con los creadores y otras empresas extrangeras, que de un servicio de hot line, de consultoría de negocio y de sistemas, que de formación en el tema, vamos básicamente que escoja un modelo de negocio basado en software GPL se va a posicionar dentro del BI analítico de una manera muy firme, y una vez situada va a ser muy difícil sacarle.

Bueno pues esta ha sido mi presentación de R, ya iremos hablado y expandiendo conocimientos sobre esta herramienta y de otra muchas también.

martes, 16 de junio de 2009

Data Mining - R gana la KDD Cup

La KDD Cup es la competición abierta de minería de datos más famosa y reconocida de todo el mundo; hace una convocatoria anual desde el 1997, y cada año plantea un problema a resolver diferente, algunos de los tratados son motores de recomendación, reconocimiento de cáncer en imágenes, minería de redes…

El reto de este año se centra en los clásicos problemas de CRM de cualquier empresa, modelizar la fuga, el up-selling y el cross-selling, ya sea con un modelo o una agrupación de ellos, donde los datos han sido cedidos por una empresa de telefonía.

Hay 2 dataset’s para trabajar, uno “pequeño” de 230 variables y uno grande de 15000 variables, contienen 50000 registros cada uno.

Este año hay 2 desafíos, uno rápido que en 5 días tienes que dar modelos para el dataset de 15000 variables y uno lento en el cual te puedes presentar tratando el dataset pequeño o el grande y en el que tienes un mes de tiempo. Se puede utilizar cualquier tipo de software ya sea libre o privativo, genérico o desarrollado en concreto para el desafío…

Hasta aquí lo normal de cada año, pero este ha sido diferente, han ganado el desafío lento tratando el dataset grande utilizando R, un programa de software libre de análisis estadístico del que estoy enamorado desde mis tiempos de universidad y del cual ya os iré hablando.

Para mí es una gran noticia, ya que viene a demostrar algo de lo cual ya estaba convencido desde hace tiempo, que con R y buenos técnicos puedes realizar cualquier análisis con un resultado igual que con SAS Enterprise Miner, SPSS Clementine o cualquier otro software privativo, y en según que casos incluso mejores.

Os dejo aquí el enlace del grupo que ha ganado el desafío.

La lastima de esta competición es que los códigos de los modelos presentados no son publicados, sería muy interesante ver como han conseguido este hito.

¿Álguien se anima a presentarse con nosotros el año que viene?

lunes, 17 de noviembre de 2008

Geomarketing y Software Libre

Hola a todos,

Tras recibir algunas (o muchas) críticas por decir que en un principio no usaría Software libre para estudios de geomarketing me toca rectificar, y como dicen por ahí eso es de sabios...¿será que lo seré? jajaja...lo dudo. Bueno al grano:

El software libre de GIS que mejor se adapta a estudios de geomarketing y al mercado, que requiere de continuas mejoras y aplicaciones es sin duda GvSIG. Yo he usado GvSIG para muchas cosas que no son Geomarketing y es un potentísimo motor GIS, pero hasta ahora, y digo hasta ahora, le faltaba un puntito que otros motores comerciales si tienen, el estudio y análisis de redes.

Algunos lectores me comentaron que con la nueva versión 2.0 ya vendrá incluida una exstensión de análisis de redes, pero como uno es un poco impaciente me puse a investigar y ver si había algo ya por la red. Y tachán...encontré el Proyecto Final de Carrera de Miguel Alvárez Úbeda que trata de esto mismo, una extensión de Analsis de redes para GvSIG. Es la guinda que le faltaba a este más que famoso soft, y que permite empezar a trabajar con él para hacer estudios de geomarketing.

El trabajo se centra en el cálculo de rutas, pero estoy seguro que de manera sencilla se podrá usar para crear áreas de influencia.

Estoy expectante de la nueva versión de GvSIG, y ver como se puede usar para Geomarketing, más que nada, porque no voy a engañar a nadie, los ahorros en licencias pueden ser abismales.