Search results

1

Zastosowanie analizy skupień do konstruowania portfeli akcji na WGPW

100%

Korzeniewski J.

Prace Naukowe Uniwersytetu Ekonomicznego we Wrocławiu

|

2017

|

issue 468

108-115

PL

Metody analizy skupień zastosowane do konstruowania portfeli papierów wartościowych mogą być konkurencyjne dla innych, bardziej tradycyjnych, metod badania ryzyka inwestycyjnego. Takie wnioski można wyciągnąć z badań amerykańskiego rynku kapitałowego z początku XXI wieku (por. [Marvin 2015; Craighead, Klemesrud 2002]). W artykule są przedstawione badania możliwości zastosowania metod analizy skupień na warszawskim rynku GPW. Badanie ma na celu zbadanie racjonalności stosowania tej grupy metod pod kątem możliwości wyboru optymalnych metod grupowania spółek niezależnie od koniunktury giełdowej, optymalnego typu danych opisujących notowania spółek, sensu przenoszenia wzorców ustalonych na rynku amerykańskim na rynek warszawski. Badanie zostało przeprowadzone na notowaniach z pięciu ostatnich lat, w okresach reprezentujących różne poziomy koniunktury giełdowe. Zbadano kilka metod grupowania danych od metod partycjonujących (k-średnich oraz PAM) do metod aglomeracyjnych.

2

Abridged Symbolic Representation of Time Series for Clustering

100%

Korzeniewski J.

Acta Universitatis Lodziensis. Folia Oeconomica

|

2019

|

vol. 2

|

issue 341

43-50

PL

W ostatnich latach pojawiły się metody symbolicznego reprezentowania szeregów czasowych. Te badania są zasadniczo motywowane względami praktycznymi, takimi jak oszczędzanie pamięci lub szybkie przeszukiwanie baz danych. Niektóre wyniki w temacie symbolicznego reprezentowania szeregów czasowych sugerują, że zapis skrócony może nawet poprawić wyniki grupowania. Artykuł zawiera propozycję nowego algorytmu ukierunkowanego na zagadnienie skróconej symbolicznej reprezentacji szeregów czasowych, a w szczególności na efektywne grupowanie szeregów. Idea propozycji polega na wykorzystaniu techniki PAA (piecewise aggregate approximation) z następną analizą korelacji otrzymanych segmentów szeregu. Podstawowym celem artykułu jest modyfikacja techniki PAA ukierunkowana na możliwość dalszego grupowania szeregów w ich skróconym zapisie. Próbowano również znaleźć odpowiedzi na następujące pytania: „Czy zadanie grupowania szeregów czasowych w ich oryginalnej postaci ma sens?”, „Ile pamięci można oszczędzić, stosując nowy algorytm?”. Efektywność nowego algorytmu została zbadana na empirycznych zbiorach danych szeregów czasowych. Wyniki pokazują, że nowa propozycja jest dość efektywna przy bardzo nikłym stopniu parametryzacji wymaganym od użytkownika.

EN

In recent years a couple of methods aimed at time series symbolic representation have been introduced or developed. This activity is mainly justified by practical considerations such memory savings or fast data base searching. However, some results suggest that in the subject of time series clustering symbolic representation can even upgrade the results of clustering. The article contains a proposal of a new algorithm directed at the task of time series abridged symbolic representation with the emphasis on efficient time series clustering. The idea of the proposal is based on the PAA (piecewise aggregate approximation) technique followed by segmentwise correlation analysis. The primary goal of the article is to upgrade the quality of the PAA technique with respect to possible time series clustering (its speed and quality). We also tried to answer the following questions. Is the task of time series clustering in their original form reasonable? How much memory can we save using the new algorithm? The efficiency of the new algorithm was investigated on empirical time series data sets. The results prove that the new proposal is quite effective with a very limited amount of parametric user interference needed.

3

Efficient Stock Portfolio Construction by Means of Clustering

100%

Korzeniewski J.

Acta Universitatis Lodziensis. Folia Oeconomica

|

2018

|

vol. 1

|

issue 333

PL

Stosując metody statystyczne do optymalizacji swoich decyzji inwestycyjnych, inwestorzy stają przed bardzo istotnym problemem skonstruowania dobrze zdywersyfikowanego portfela inwestycyjnego składającego się z niewielkiej liczby pozycji. Wśród wielu metod stosowanych do konstrukcji takiego portfela są metody wykorzystujące grupowanie wszystkich spółek w homogeniczne grupy spółek, po którym to etapie następuje wybieranie reprezentanta każdej grupy w celu utworzenia ostatecznej postaci portfela. Etap grupowania nie musi pokrywać się z przynależnością sektorową spółek. Grupowanie może być wykonywane za pomocą metod analizy skupień i w tym procesie bardzo istotne jest ustalanie właściwej liczby skupień. Celem niniejszego artykułu jest zaproponowanie nowej techniki konstrukcji portfela inwestycyjnego, odnoszącej się zarówno do ustalenia liczby pozycji w portfelu, jak również do wyboru reprezentantów skupień. Stosowane metody grupowania spółek to klasyczna metoda k‑średnich oraz algorytm PAM (Partitioning Around Medoids). Technika jest testowana na danych 85 największych spółek giełdowych z parkietu warszawskiego z lat 2011–2016. Wyniki są bardzo obiecujące w sensie możliwości opracowania algorytmu opartego na analizie skupień, który prawie nie wymagałby interwencji inwestora.

EN

When investors start to use statistical methods to optimise their stock market investment decisions, one of fundamental problems is constructing a well‑diversified portfolio consisting of a moderate number of positions. Among a multitude of methods applied to the task, there is a group based on dividing all companies into a couple of homogeneous groups followed by picking out a representative from each group to create the final portfolio. The division stage does not have to coincide with the sector affiliation of companies. When the division is performed by means of clustering of companies, a vital part of the process is to establish a good number of clusters. The aim of this article is to present a novel technique of portfolio construction based on establishing a numer of portfolio positions as well as choosing cluster representatives. The grouping methods used in the clustering process are the classical k‑means and the PAM (Partitioning Around Medoids) algorithm. The technique is tested on data concerning the 85 biggest companies from the Warsaw Stock Exchange for the years 2011–2016. The results are satisfactory with respect to the overall possibility of creating a clustering‑based algorithm requiring almost no intervention on the part of the investor.

4

A Modification of the Leacock-Chodorow Measure of the Semantic Relatedness of Concepts

100%

Korzeniewski J.

Acta Universitatis Lodziensis. Folia Oeconomica

|

2020

|

vol. 6

|

issue 351

97-106

PL

Miary semantycznego podobieństwa pojęć można podzielić na dwa rodzaje: metody oparte na wiedzy i metody oparte na bazie tekstów. Techniki oparte na wiedzy stosują stworzone przez człowieka słowniki oraz inne opracowania. Techniki oparte na bazie tekstów oceniają podobieństwo semantyczne dwóch pojęć, odwołując się do obszernych baz dokumentów tekstowych. Niektórzy badacze twierdzą, że miary oparte na wiedzy są lepsze jakościowo od tych opartych na bazie tekstów, ale o wiele istotniejsze jest to, że te drugie zależą bardzo mocno od użytej bazy tekstów. W niniejszym artykule przedstawiono propozycję modyfikacji najlepszej metody pomiaru semantycznego podobieństwa pojęć, opartej na sieci WordNet, a mianowicie miary Leacock‑Chodorowa. Ta miara była najlepsza w kilku eksperymentach badawczych oraz można zapisać ją za pomocą prostej formuły. Nową propozycję oceniono na podstawie dwóch popularnych benchmarkowych zbiorów par pojęć, tj. zbioru 65 par pojęć Rubensteina‑Goodenougha oraz zbioru 353 par pojęć Fickelsteina. Wyniki pokazują, że przedstawiona propozycja spisała się lepiej od tradycyjnej miary Leacock‑Chodorowa.

EN

The measures of the semantic relatedness of concepts can be categorised into two types: knowledge‑based methods and corpus‑based methods. Knowledge‑based techniques make use of man‑created dictionaries, thesauruses and other artefacts as a source of knowledge. Corpus‑based techniques assess the semantic similarity of two concepts making use of large corpora of text documents. Some researchers claim that knowledge‑based measures outperform corpus‑based ones, but it is much more important to observe that the latter ones are heavily corpus dependent. In this article, we propose to modify the best WordNet‑based method of assessing semantic relatedness, i.e. the Leacock‑Chodorow measure. This measure has proven to be the best in several studies and has a very simple formula. We asses our proposal on the basis of two popular benchmark sets of pairs of concepts, i.e. the Ruben‑Goodenough set of 65 pairs of concepts and the Fickelstein set of 353 pairs of terms. The results prove that our proposal outperforms the traditional Leacock‑Chodorow measure.

5

New algorithm for determining the number of features for the effective sentiment-classification of text documents

63%

Idczak A., Korzeniewski J.

Wiadomości Statystyczne. The Polish Statistician

|

2023

|

vol. 68

|

issue 5

40-57

PL

Analiza sentymentu, czyli wydźwięku emocjonalnego, dokumentów tekstowych stanowi bardzo ważną część współczesnej eksploracji tekstu (ang. text mining). Celem artykułu jest przedstawienie nowej techniki analizy sentymentu tekstu, która może znaleźć zastosowanie w dowolnej metodzie klasyfikacji dokumentów ze względu na ich wydźwięk emocjonalny. Proponowana technika polega na niezależnym od klasyfikatora doborze cech, co skutkuje zmniejszeniem rozmiaru ich przestrzeni. Zaletami tej propozycji są intuicyjność i prostota obliczeniowa. Zasadniczym elementem omawianej techniki jest nowatorski algorytm ustalania liczby terminów wystarczających do efektywnej klasyfikacji, który opiera się na analizie korelacji pomiędzy pojedynczymi cechami dokumentów a ich wydźwiękiem. W celu weryfikacji przydatności proponowanej techniki zastosowano podejście statystyczne. Wykorzystano dwie metody: naiwny klasyfikator Bayesa i regresję logistyczną. Za ich pomocą zbadano trzy zbiory dokumentów składające się z 1169 opinii klientów jednego z banków działających na terenie Polski uzyskanych w 2020 r. Dokumenty zostały napisane w języku polskim. Badanie pokazało, że kilkunastokrotne zmniejszenie liczby terminów przy zastosowaniu proponowanej techniki na ogół poprawia jakość klasyfikacji.

EN

Sentiment analysis of text documents is a very important part of contemporary text mining. The purpose of this article is to present a new technique of text sentiment analysis which can be used with any type of a document-sentiment-classification method. The proposed technique involves feature selection independently of a classifier, which reduces the size of the feature space. Its advantages include intuitiveness and computational noncomplexity. The most important element of the proposed technique is a novel algorithm for the determination of the number of features to be selected sufficient for the effective classification. The algorithm is based on the analysis of the correlation between single features and document labels. A statistical approach, featuring a naive Bayes classifier and logistic regression, was employed to verify the usefulness of the proposed technique. They were applied to three document sets composed of 1,169 opinions of bank clients, obtained in 2020 from a Poland-based bank. The documents were written in Polish. The research demonstrated that reducing the number of terms over 10-fold by means of the proposed algorithm in most cases improves the effectiveness of classification.

Refine search results

3 Acta Universitatis Lodziensis. Folia Oeconomica

1 Prace Naukowe Uniwersytetu Ekonomicznego we Wrocławiu

1 Wiadomości Statystyczne. The Polish Statistician

1 2023

1 2020

1 2019

1 2018

1 2017

5 Korzeniewski J.

1 Idczak A.

Zastosowanie analizy skupień do konstruowania portfeli akcji na WGPW

Abridged Symbolic Representation of Time Series for Clustering

Efficient Stock Portfolio Construction by Means of Clustering

A Modification of the Leacock-Chodorow Measure of the Semantic Relatedness of Concepts

New algorithm for determining the number of features for the effective sentiment-classification of text documents