Гость
Целевая тема:
Создать новую тему:
Автор:
Форумы / Java [игнор отключен] [закрыт для гостей] / Анализ звука алгоритмом FFT / 25 сообщений из 43, страница 1 из 2
20.03.2012, 20:07:55
    #37714385
etnos
Гость
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
Привет,

стоит задача обработать запись голоса с микрофона и выдать инфу о всех возможных (реализуемых) характеристиках голоса.

написал программу для андроид, голос записывается с микрофона в формате byte[] or short[]

public static int bufferSize = AudioRecord.getMinBufferSize(8000,
AudioFormat.CHANNEL_CONFIGURATION_MONO,
AudioFormat.ENCODING_PCM_16BIT);

private static final int audioEncoding = AudioFormat.ENCODING_PCM_16BIT;

recordInstance = new AudioRecord(MediaRecorder.AudioSource.MIC,
8000, AudioFormat.CHANNEL_CONFIGURATION_MONO,
audioEncoding, bufferSize);


tempBuffer = new byte[bufferSize];

recordInstance.read(tempBuffer, 0, bufferSize);


в итоге каждую секунду получаю tempBuffer - данные с микрофона.

после этого использую библиотку JTransforms.jar для анализа данных алгоритмом FFT. получаю массив float. A что делать дальше?

интересует:
1. амплитуда,
2. частота,
3. Duration in seconds
4. Mean pitch
5. Std dev pitch
6. Min pitch
7. Max pitch
8. Nr of pulses
9. Nr of period
10. Mean for one period
11. Std dev for one period
12. Fraction of unvoice frames
13. Nr of voice break
14. Procent of voice break
...
Рейтинг: 0 / 0
21.03.2012, 10:43:34
    #37715098
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
жаба-то причём тут? Если не знаешь что представляет из себя массив с результатом быстрого преобразования фурье то надо почитать теорию. Вот тут например
http://websound.ru/

в общем случае БПФ тебе в анализе голоса не очень поможет.
...
Рейтинг: 0 / 0
21.03.2012, 20:06:08
    #37716653
etnos
Гость
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
1024,

ок, спасибо за ссылку, почитаю что там есть.

Если для анализа голоса БПФ мне не поможет, то что лучше использовать ?
...
Рейтинг: 0 / 0
21.03.2012, 22:06:16
    #37716860
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
etnos1024,

ок, спасибо за ссылку, почитаю что там есть.

Если для анализа голоса БПФ мне не поможет, то что лучше использовать ?

не знаю. Зависит от задачи.
...
Рейтинг: 0 / 0
22.03.2012, 00:42:39
    #37717010
ShSerge
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
etnos,

Имхо, преобразование Фурье Вы правильно выбрали. Правильной дорогой идёте.
...
Рейтинг: 0 / 0
22.03.2012, 08:09:49
    #37717141
Реалист
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
ShSergeetnos,

Имхо, преобразование Фурье Вы правильно выбрали. Правильной дорогой идёте.
БПФ позволяет анализировать только одну из характеристик голоса - частотную.
Но у голоса есть и амплитудные параметры, которые с помощью преобразования Фурье анализировать в принципе невозможно, так как они "размываются" во времени. И время "размытия" тем больше, чем точнее будет анализироваться частотные характеристики голоса (чем больше будет окно преобразования).

Поэтому для анализа голоса нужно использовать два типа преобразований - Фурье для анализа частотного спектра и Вейвлет для анализа амплитудно-временных характеристик. Если использовать только БПФ, то из анализа выпадут таки звуки, как К,Ч,Т,П и т.д. То есть те, в которых присутствует "взрывная" составляющая.
...
Рейтинг: 0 / 0
22.03.2012, 10:30:14
    #37717301
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
РеалистShSergeetnos,

Имхо, преобразование Фурье Вы правильно выбрали. Правильной дорогой идёте.
БПФ позволяет анализировать только одну из характеристик голоса - частотную.
Но у голоса есть и амплитудные параметры, которые с помощью преобразования Фурье анализировать в принципе невозможно, так как они "размываются" во времени. И время "размытия" тем больше, чем точнее будет анализироваться частотные характеристики голоса (чем больше будет окно преобразования).

Поэтому для анализа голоса нужно использовать два типа преобразований - Фурье для анализа частотного спектра и Вейвлет для анализа амплитудно-временных характеристик. Если использовать только БПФ, то из анализа выпадут таки звуки, как К,Ч,Т,П и т.д. То есть те, в которых присутствует "взрывная" составляющая.

а зачем? Цель-то какая? Ну будет получен спектр слова "Жопа" произнесённого бухгалтером Марией Петровной. А дальше что? Зависит от конечной цели.
...
Рейтинг: 0 / 0
22.03.2012, 11:39:45
    #37717496
Реалист
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
1024,

Я просто показал, что одной информации из БПФ "о всех возможных (реализуемых) характеристиках голоса" может оказаться недостаточно.
Понятно, что все зависит от конечной цели. В противном случае можно было бы использовать не БПФ, а просто обычное вычитание
...
Рейтинг: 0 / 0
22.03.2012, 13:37:05
    #37717790
etnos
Гость
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
Цель проекта в том, чтобы сравнивать голос человека через оприделенное время, к примеру, через 5 мин, и потом на основе характеристик голоса сделать вывод как на человека повлияло то, что он делал в течении этих 5мин.

а в течении этих 5 мин пользователю будет показывать видео, в котором будет много эмоциональных моментов.

вот суть в том, чтобы оприделить какие именно эмоции влияют больше всего на данного человека.

к примеру 5-6 различных видео с различными эмоциями и нужно выявить которое из эмоций наибольше всего повлияло на человека
...
Рейтинг: 0 / 0
22.03.2012, 14:18:38
    #37717904
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
etnosЦель проекта в том, чтобы сравнивать голос человека через оприделенное время, к примеру, через 5 мин, и потом на основе характеристик голоса сделать вывод как на человека повлияло то, что он делал в течении этих 5мин.

а в течении этих 5 мин пользователю будет показывать видео, в котором будет много эмоциональных моментов.

вот суть в том, чтобы оприделить какие именно эмоции влияют больше всего на данного человека.

к примеру 5-6 различных видео с различными эмоциями и нужно выявить которое из эмоций наибольше всего повлияло на человека

к жаве это точно отношения не имеет. Да и к программированию наверна тоже - тут же надо сначала выяснить какие характеристики являются значимыми. Вобщем не сюда.
...
Рейтинг: 0 / 0
22.03.2012, 15:24:29
    #37718062
Реалист
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
1024,

+1024 (Извини за тавтологию)
...
Рейтинг: 0 / 0
22.03.2012, 17:20:49
    #37718377
etnos
Гость
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
1024к жаве это точно отношения не имеет. Да и к программированию наверна тоже - тут же надо сначала выяснить какие характеристики являются значимыми. Вобщем не сюда.

может действительно не сюда, но проект пишется на Java. Нужные характеристики тоже известны, это:
1. амплитуда,
2. частота,
3. Duration in seconds
4. Mean pitch
5. Std dev pitch
6. Min pitch
7. Max pitch
8. Nr of pulses
9. Nr of period
10. Mean for one period
11. Std dev for one period
12. Fraction of unvoice frames
13. Nr of voice break
14. Procent of voice break

я ресечил в гугле и ничего кроме FFT по анализу звука не нашел, вот по этому меня и интересует может есть библиотеки или алгоритмы или открытые проекты или статьи в которых описывается как из записанного с микрофона голоса можно найти нужные параметры?
...
Рейтинг: 0 / 0
22.03.2012, 17:39:52
    #37718449
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
etnos1024к жаве это точно отношения не имеет. Да и к программированию наверна тоже - тут же надо сначала выяснить какие характеристики являются значимыми. Вобщем не сюда.

может действительно не сюда, но проект пишется на Java. Нужные характеристики тоже известны, это:
1. амплитуда,
2. частота,
3. Duration in seconds
4. Mean pitch
5. Std dev pitch
6. Min pitch
7. Max pitch
8. Nr of pulses
9. Nr of period
10. Mean for one period
11. Std dev for one period
12. Fraction of unvoice frames
13. Nr of voice break
14. Procent of voice break

я ресечил в гугле и ничего кроме FFT по анализу звука не нашел, вот по этому меня и интересует может есть библиотеки или алгоритмы или открытые проекты или статьи в которых описывается как из записанного с микрофона голоса можно найти нужные параметры?

у тебя есть набор байтов с микрофона. Что есть амплитуда? Ну найди в массиве самое большое число. Чисто статистически это максимальная амплитуда. Что это тебе даст? Да ничего.

или 7. Max pitch - это максимальная частота из спектра, насколько я понимаю - разложил БПФ слова "Жопа", нашёл её (причём приблизительно, точных частот он тебе не найдёт). Что дальше?

Так же и по остальным пунктам.

По-моему это сложный проект, не знаю ни одного качественного решения. Есть например такое
http://www.shazam.com/

- на сервере хранятся "слепки" (soundprint) музыки т.е. примерно как у тебя - характеристики частот, пауз, скачков громкости и пр. Можно мобилу к радио поднести, сервис с микрофона считает песню в плохом качестве но сможет в своей базе найти по слепку.

Кратко о технологии http://en.wikipedia.org/wiki/Acoustic_fingerprint

Чтонить из этой области надо смотреть. Но это к жабе отношения не имеет.
...
Рейтинг: 0 / 0
22.03.2012, 19:56:32
    #37718721
grasoff.net
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
http://linux-sound.org/dsp.html
http://miracle.otago.ac.nz/tartini/

ну и тут ещё можно что-то спрашивать )

JTransforms, кстати, да - хороша )
...
Рейтинг: 0 / 0
22.03.2012, 20:32:49
    #37718757
x1ca4064
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
etnos1. амплитуда,
2. частота,
3. Duration in seconds
4. Mean pitch
5. Std dev pitch
6. Min pitch
7. Max pitch
8. Nr of pulses
9. Nr of period
10. Mean for one period
11. Std dev for one period
12. Fraction of unvoice frames
13. Nr of voice break
14. Procent of voice break


Попробуйте, для начала, перевести названия этих параметров на русский.

ИМХО, конечно, но мне кажется, что большинство этих параметров вычисляются во временном домене, а не в частотном. Хотя некоторые (Mean pitch - средняя интенсивность?) можно вычислять в обоих доменах
...
Рейтинг: 0 / 0
23.03.2012, 02:26:40
    #37719133
etnos
Гость
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
по этому описанию en.wikipedia.org/wiki/Pitch_(music) pitch рассчитывается с помощью частоты. по этому в списке нужных характеристик присутствует частота.

в зависимости от силы воздействия эмоции (насколько человек может прочувствовать эмоцию) mean pitch изменяется в приделах 2% - 7% система которую я пишу как раз и должна улавливать это изменение или отсутствие изменений, что также важно.



private float[] spectrumAnalyz(float[] spectr) {
float Re;
float Im;
float[] spectruData = spectr;
float[] mySpectrum = new float[(spectruData.length / 2) - 1];
for (int i = 1, j = 0; i < spectruData.length / 2; i++, j++) {
Re = spectruData[2 * i];
Im = spectruData[2 * i + 1];
mySpectrum[j] = (float) Math.sqrt(Re * Re + Im * Im);
}
return mySpectrum;
}

собственно этот метод принимает на вход массив который вернул алгоритм FFT. хочу спросить у тех, кто работал раньше с FFT, это правильная формула для нахождения спектра частот ? ведь если у меня будут частоты, то я смогу найти хотя бы pitch
...
Рейтинг: 0 / 0
23.03.2012, 10:22:57
    #37719472
oneHalf
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
Начинай с теории - т.к. у тебя каша в голове - задай себе простой вопрос - зачем для своего анализа ты используешь преобразование Фурье? Что оно тебе в твоем случае дает такого, чего не даст сигнал во временном пространстве?
После этого - если все же тебе нужно Фурье - тогда читай теорию - там нельзя просто тупо запихивать входные данные - его надо "настраивать" под каждое преобразование - zeros padding, размер окна, чтоб не пропустить частоты и увидеть динамику спектра.
...
Рейтинг: 0 / 0
23.03.2012, 11:15:30
    #37719604
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
etnosпо этому описанию en.wikipedia.org/wiki/Pitch_(music) pitch рассчитывается с помощью частоты. по этому в списке нужных характеристик присутствует частота.

в зависимости от силы воздействия эмоции (насколько человек может прочувствовать эмоцию) mean pitch изменяется в приделах 2% - 7% система которую я пишу как раз и должна улавливать это изменение или отсутствие изменений, что также важно.



private float[] spectrumAnalyz(float[] spectr) {
float Re;
float Im;
float[] spectruData = spectr;
float[] mySpectrum = new float[(spectruData.length / 2) - 1];
for (int i = 1, j = 0; i < spectruData.length / 2; i++, j++) {
Re = spectruData[2 * i];
Im = spectruData[2 * i + 1];
mySpectrum[j] = (float) Math.sqrt(Re * Re + Im * Im);
}
return mySpectrum;
}

собственно этот метод принимает на вход массив который вернул алгоритм FFT. хочу спросить у тех, кто работал раньше с FFT, это правильная формула для нахождения спектра частот ? ведь если у меня будут частоты, то я смогу найти хотя бы pitch

Это не нахождение спектра частот. Это преобразование массива комплексных чисел в массив обычных. БПФ вычисляется по мнимым (комплексным числам) и некоторые реализации алгоритма их в комплексном виде возвращают.

Само БПФ не даёт расклада по частотам. Оно даёт приблизительный ответ на вопросы типа "сколько частот в оцифрованном куске примерно равных 100Гц +-10Гц". Даже для волн одинаковой частоты но разных по форме (квадратные и синусоидальные) БПФ вернёт разный массив данных.

Описанная тобой задача сложна, без теории заниматься ей нет смысла. Прочитай по ссылкам выше. Ближе всего к задача тема AcousticFingerPrint (SoundPrint).
...
Рейтинг: 0 / 0
23.03.2012, 12:14:48
    #37719777
etnos
Гость
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
ок, спасибо большое! буду читать теорию
...
Рейтинг: 0 / 0
24.03.2012, 04:07:38
    #37721102
recvezitor
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
1024Это не нахождение спектра частот. Это преобразование массива комплексных чисел в массив обычных. БПФ вычисляется по мнимым (комплексным числам) и некоторые реализации алгоритма их в комплексном виде возвращают.

Само БПФ не даёт расклада по частотам. Оно даёт приблизительный ответ на вопросы типа "сколько частот в оцифрованном куске примерно равных 100Гц +-10Гц". Даже для волн одинаковой частоты но разных по форме (квадратные и синусоидальные) БПФ вернёт разный массив данных.

Описанная тобой задача сложна, без теории заниматься ей нет смысла. Прочитай по ссылкам выше. Ближе всего к задача тема AcousticFingerPrint (SoundPrint).

это нахождение спектра частот при условии что массив spectruData содержит данные полученные после применения БПФ к исходному сигналу, обычный амплитудный спектр. БПФ дает распределение по частотам, нафиг оно таогда вообще нужно. Другой вопрос, что работает он в предположении бесконечных гармонических колебаний. Но есть куча всего что обходит эти ограничения для дискретного конечного сигнала - единственный вариант который можно преобразовать с помощью цифровых методов обработки.
Я бы посоветовал найти матлаб крякнутый, там всего много. Даже слишком много, но там есть по карйней мере правильно работающие алгоритмы и местами даже теория в документации есть.
Была у меня книжечка где оооочень подробно и на пальцах объясняется что к чему, но найти пока не могу
...
Рейтинг: 0 / 0
24.03.2012, 10:36:47
    #37721161
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
это именно преоразование комплексных чисел в обычные.

БПФ не даёт точное распределение по частотам, как я говорил, даже для волн одинаковой частоты но разных по форме (квадратные и синусоидальные) БПФ вернёт разный массив данных. Пользуются им от того что ничего лучше пока не придумано.

Речь это не один сигнал, это набор частот. Восстановить набор частот по конечно сумме частот невозможно (типа по цифре 100 догадаться что она является суммой 50+50 или 60+30+10). Это, условно, можно решить перебором и статистическим анализом.

Книжек много разных но сама поставленная задача сложна. Не знаю ни одной качественной реализации подобного.
...
Рейтинг: 0 / 0
24.03.2012, 18:49:27
    #37721464
recvezitor
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
посмотри внимательно чувак. Что есть преобразование коплексных чисел в обычные? Да там разделяются массив состоящий из реальных и мнимых частей на реальный массив и мнимый, потмоу что в яве нет встроенного комплексного типа, но на следующую формулу посмотри. Это спектр либо мощности либо амплитуды (сейчас не могу точно сказать).
Про книжку я имел ввиду именно что такое БПФ, потмоу что явно понимания нет. Про распознование речи естественно я ничего не говорил. Слишком сложное понятие, но параметры которые хочет автор весьма стандартные и вычисляются через БПФ или производные. Но перечисленные парапаметры применимы к стационарным сигналам. Например к речи и любому более менее сложному сигналу не применимо понятие частота и амплиутда. Говорят обычно об оценке параметров, обычно энергетические характеристики такие как усредненныая амплитуда, SEL, SPL. Нестационарные процессы боее сложны и да там вохможно нужны вейвлет преобразования.
авторРечь это не один сигнал, это набор частот.
ты путаешься в терминологии. Нет речь это один сигнал, если под сигналом подразумевать временную развертку выбранного интервала речи. Но да, там дохрена частот.
...
Рейтинг: 0 / 0
25.03.2012, 00:18:34
    #37721635
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
recvezitorпосмотри внимательно чувак. Что есть преобразование коплексных чисел в обычные? Да там разделяются массив состоящий из реальных и мнимых частей на реальный массив и мнимый, потмоу что в яве нет встроенного комплексного типа, но на следующую формулу посмотри. Это спектр либо мощности либо амплитуды (сейчас не могу точно сказать).

если не можешь точно сказать то зачем лезешь спорить. Чувак.
...
Рейтинг: 0 / 0
25.03.2012, 02:57:18
    #37721682
recvezitor
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
чувак потому что там разница в наличии и отсутвтвия корня и нормировки, я не помню просто уже. Но факт на лицо что там спектр, а не тот бред авторэто именно преоразование комплексных чисел в обычные, я с этим работал, правда пол года назад уже, так что я шарю поверь мне.
авторБПФ вычисляется по мнимым это вообще лол
...
Рейтинг: 0 / 0
25.03.2012, 11:43:57
    #37721772
1024
Участник
Скрыть профиль Поместить в игнор-лист Сообщения автора в теме
Анализ звука алгоритмом FFT
recvezitorчувак потому что там разница в наличии и отсутвтвия корня и нормировки, я не помню просто уже. Но факт на лицо что там спектр, а не тот бред авторэто именно преоразование комплексных чисел в обычные, я с этим работал, правда пол года назад уже, так что я шарю поверь мне.
авторБПФ вычисляется по мнимым это вообще лол

думаю что не шаришь. В противном случае ты бы смог подсказать топикстартеру что делать в его случае.
...
Рейтинг: 0 / 0
Форумы / Java [игнор отключен] [закрыт для гостей] / Анализ звука алгоритмом FFT / 25 сообщений из 43, страница 1 из 2
Найденые пользователи ...
Разблокировать пользователей ...
Читали форум (0):
Пользователи онлайн (0):
x
x
Закрыть


Просмотр
0 / 0
Close
Debug Console [Select Text]